【发布时间】:2020-09-26 10:35:50
【问题描述】:
我正在合并两个数据框,但是当我这样做时,我有很多重复的条目。 我的代码有点长,下面是两个数据集的例子:
df1
Season SeasonType ... PitchingWalksPerNineInnings_17 PitchingWeightedOnBasePercentage_17
GameID ...
47547 2017.0 1.0 ... NaN NaN
47546 2017.0 1.0 ... NaN NaN
50022 2017.0 1.0 ... NaN NaN
47556 2017.0 1.0 ... NaN NaN
47557 2017.0 1.0 ... NaN NaN
... ... ... ... ... ...
49970 2017.0 1.0 ... NaN NaN
49964 2017.0 1.0 ... NaN NaN
49974 2017.0 1.0 ... NaN NaN
49975 2017.0 1.0 ... NaN NaN
47562 NaN NaN ... NaN NaN
df2
GameID StatID_28 ... PitchingWalksPerNineInnings_28 PitchingWeightedOnBasePercentage_28
0 47562 1748078 ... 5.0 0.351
[1 rows x 52 columns]
GameID 列是我对两者的索引。 df1 可以有多个与 df2 相似的列,这就是我使用它来获取它们的原因:
columnsMerge = list(set(df.columns).intersection(set(tpstatdf.columns)))
columnsMerge.append('GameID')
我已经分享了这里生成的 csv 文件:https://drive.google.com/drive/folders/1RVKNsB42ixQ2I2WUqqu_dDNjmcVIz5No?usp=sharing
请在下面找到我得到的。预计只有一行带有游戏 id,并与以下两行聚合。
对此的任何帮助将不胜感激。
谢谢
杰弗里
【问题讨论】:
-
不,放置副本不起作用。实际上,只有一列是重复的。更好的功能将是类似 fuse,基于 gameid 列