【发布时间】:2017-07-12 15:03:58
【问题描述】:
这是我的简化示例 df:
salesPerson customer measure timeStamp
--------------------------------------
A 123 I 12:30
A 123 II 12:30
A 123 III 12:30
B 123 IV 12:35
C 456 I 14:30
C 456 II 14:30
D 456 III 14:15
我想要做的是归档数据框,如果 2 个不同的销售人员 ID 具有相同的客户编号,请保留时间戳最早的销售人员的所有行。此示例中的结果 df 将是:
salesPerson customer measure timeStamp
--------------------------------------
A 123 I 12:30
A 123 II 12:30
A 123 III 12:30
D 456 III 14:15
最好/最 Pythonic 的方法是什么?我考虑过使用 pandas groupby.filter 或 groupby.transform,但坦率地说不知道如何准确地编写这些。
奖励积分将用于将已删除的行放在单独的 deleted_df 对象中。
【问题讨论】:
标签: python pandas pandas-groupby