【问题标题】:With datatable is there a way to make faster appending than DataFrame?使用 datatable 有没有办法比 DataFrame 更快地追加?
【发布时间】:2021-10-26 12:17:41
【问题描述】:

我知道在数据表中读取 csv 文件比 pandas DataFrame 快得多。

然而,就我而言

我有几个 csv 文件,我必须一一追加。

所以我正在将所有这些 pd.read_csv(file) 附加到空 DataFrame。

读取带有数据表的csv文件并将其附加到空数据表会更快吗

然后最终将最终数据表转换为 csv?

所以我想知道除了 pandas DataFrame 之外的最快的追加 csv 文件的方法

【问题讨论】:

  • 请分享您如何在数据表与熊猫中执行此操作的代码,以便我们更好地理解您的意思并提出可能的解决方案。另外,请将标签更改为 py-datatable
  • 另外,您可以使用freadiread(多个文件的延迟读取)读取所有文件,并使用dt.rbind 将它们合并为一个。同样,共享您的代码或一些示例数据框会很有帮助。不确定我撰写的 blog post 是否会有所帮助。

标签: pandas dataframe py-datatable


【解决方案1】:

当我有很多 csv 文件时,我会这样做。

我使用glob来抓取所有的csv文件路径:

from glob import glob
all_csvs = glob('path-to-folder-containing-csv-files/*.csv')

现在阅读所有这些并附加它们。

all_csvs_appended = dt.rbind(iread(all_csvs))

如果您的所有 csv 文件没有相同的列,您可能需要将 force=True 添加到 rbind

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2020-07-16
    • 1970-01-01
    • 1970-01-01
    • 2022-07-06
    • 2014-10-16
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多