【问题标题】:Subset pandas dataframe子集熊猫数据框
【发布时间】:2016-03-28 09:25:06
【问题描述】:

我有一个包含以下列的 pandas 数据框:cust_email, transaction_id, transaction_timestamp

我想对 pandas 数据框进行子集化,并仅包括那些只有一笔交易的电子邮件 ID(即,cust_email 只有一个 transaction_id, transaction_timestamp)

【问题讨论】:

标签: python pandas group-by dataframe subset


【解决方案1】:

您可以使用drop_duplicates并将参数keep设置为False。如果要按特定列删除重复项,可以使用 subset 参数:

df.drop_duplicates(subset="cust_email", keep=False)

例如

import pandas as pd

data = pd.DataFrame()
data["col1"] = ["a", "a", "b", "c", "c", "d", "e"]
data["col2"] = [1,2,3,4,5,6,7]

print(data)
print()
data.drop_duplicates(subset="col1", keep=False)

https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.drop_duplicates.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-06-02
    • 1970-01-01
    • 1970-01-01
    • 2018-08-20
    • 2019-03-19
    • 1970-01-01
    相关资源
    最近更新 更多