【发布时间】:2020-05-21 05:54:59
【问题描述】:
我有 100 个文件要合并,每个文件有 1 亿行以索引为键。每个的列数只有 2。
我曾尝试使用 pandas 将它们合并在一起,但似乎加入或合并超过 1000 万行 dataframe 非常慢。
是否有其他有效的方法将数据组合在一起?内存不是问题,我使用的是 256GByte 内存服务器。
filenames = ['fn1', 'fn2', 'fn3', 'fn4',....]
dfs = [pd.read_csv(filename, index_col=index_col) for filename in filenames)]
dfs[0].join(dfs[1:])
我放弃了使用pandas 来合并数据。相反,我使用hash table 合并数据并将数据转换为Dataframe。
【问题讨论】:
标签: python pandas dataframe merge