【发布时间】:2020-11-10 12:17:35
【问题描述】:
当数据量这么大时,我应该如何将数据框df(800 万行)中的label 列合并到另一个数据框df2(1.43 亿行)?
基本上我只想将label列映射到df2,df中的所有数据都包含在df2中,除了label列。无论如何我可以解决这个问题而不是使用merge()?
尝试运行下面的代码,但是运行了5个小时没有任何反应。
result = pd.merge(df,df2,on=["X", "Y", "Z"], how='left')
result
df
df2
【问题讨论】:
-
我认为这是某些数据库的任务,如果需要 python dask 或其他替代方法。在纯熊猫中需要大内存...
-
@jezrael 其实这是点云数据,每一行代表一个数据点。你会推荐使用关系数据库/noSQL 数据库来处理它吗?
-
不幸的是我没有经验,所以不能:(
-
@jezrael 不用担心,谢谢 :) !
标签: python pandas dataframe large-data