【发布时间】:2021-09-09 17:15:07
【问题描述】:
我目前正在处理一个如下所示的大数据集:
我遇到的问题是,每天报告的病例分为“阴性”、“阳性”和“不确定”病例。我的目标是总结每天报告的病例数,但同时我还想为每种病例创建单独的列(每天一列负面案例,一列用于正面案例,另一列用于不确定的)。
为了达到我的目标,我需要做的就是通过使用overall_outcome 列和new_results_reported 列创建条件来稍微过滤数据集。 我尝试了否定的情况:
america3 = pd.DataFrame(data, columns = ['overall_outcome', 'new_results_reported']) contain_values = america3[america3['overall_outcome'].str.contains('Negative')] contain_values.head(20)
我只是不知道我这样做是否正确。如果我所做的有些正确,那么我仍然无法弄清楚如何仅使用负数创建一个新列。如果它不正确,那么我不知道下一步该采取什么步骤。我想问题在于overall_outcome 是一个对象,而new_results_reported 是一个int64。
我希望我说得通。
【问题讨论】:
-
欢迎来到 StackOverflow!请查看如何创建minimal reproducible example。具体来说,我们需要一个您预期输出的示例。 How to make good reproducible pandas examples 也是与这个问题非常相关的讨论。
标签: python pandas types conditional-statements multiple-columns