【问题标题】:extract duplicates into a new df [duplicate]将重复项提取到新的 df [重复]
【发布时间】:2021-10-16 06:03:09
【问题描述】:

我有一个看起来像这样的 df:

ID  Name  Long   Lat
1   X     2      3
5   Z     2      3
8   U     1      5

有些行与 Long 或 Lat 值重复。我知道这一点,因为这会返回一个大于 0 的值。

len(df['Long'])-len(df['Long'].drop_duplicates())

如何删除重复的重复行(long/lat),以便将重复的重复行提取到新的 df(连同标题)?

例如,我原来的 df 现在应该是

ID  Name  Long   Lat
1   X     2      3
8   U     1      5

df2 应该是

ID  Name  Long   Lat
5   Z     2      3

【问题讨论】:

  • 请从intro tour 重复on topichow to ask。 “告诉我如何解决这个编码问题”不是堆栈溢出问题。我们希望您做出诚实的尝试,然后然后就您的算法或技术提出一个具体的问题。

标签: python python-3.x pandas dataframe duplicates


【解决方案1】:

你可以使用.duplicated:

mask = df.duplicated(["Long", "Lat"])

print(df[mask])
print(df[~mask])

打印:

   ID Name  Long  Lat
1   5    Z     2    3

   ID Name  Long  Lat
0   1    X     2    3
2   8    U     1    5

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2014-07-01
    • 1970-01-01
    • 2023-04-05
    • 1970-01-01
    • 2020-11-28
    • 1970-01-01
    • 2022-01-17
    • 2023-01-30
    相关资源
    最近更新 更多