【发布时间】:2018-06-26 15:46:43
【问题描述】:
我有一个大约 100 万行的 DataFrame,以及大约 10 万个独特事件。有 1 列 Won 每个事件 1 行设置为 True,事件中的每一行都设置为 False。
即,
Event ID Runner ID Won
E1 R1 True
E1 R2 False
E1 R3 False
E2 R4 True
E2 R5 False
E2 R6 False
我想最终得到一个平衡的 DataFrame,每组只有 1 个获胜者,并且只有 1 个非获胜者。
即,
Event ID Runner ID Won
E1 R1 True
E1 R3 False
E2 R4 True
E2 R5 False
我不在乎每场比赛选出哪个非获胜者,只要有 1 名获胜者,1 名非获胜者即可。
对于 pandas,我尝试了一些方法,选择获胜者和非获胜者,
_won = df.Won
winners = df[_won]
non_winners = df[~_won]
但是我看到的每个过程,并尝试在每场比赛中选择 1 名非获胜者都非常缓慢 - 每场比赛只需几秒钟(当你有 10 万场比赛时,这在 IMO 是不合理的)。
与group 和apply 合一,
new_df = winners.append(
non_winners
.groupby('Event ID')
.apply(lambda grp: grp.sample(1))
遍历 groupby,
for event_id, grp in non_winners.groupby('Event ID'):
winners.append(grp.sample(1))
遍历获胜者的事件 ID,
event_ids = set(winners['Event ID'].drop_duplicates())
for event_id in event_ids:
winners.append(
non_winners[non_winners['Event ID'] == event_id].sample(1))
但在处理 ~100 万和 ~100k 事件时,每个选项似乎都非常慢。
【问题讨论】: