【发布时间】:2016-10-12 15:20:36
【问题描述】:
我有一个超过16G的CSV文件,每一行都是文本数据。当我对整个 CSV 文件数据进行编码(例如 one-hot-encode)时,由于内存限制,我的进程被终止了。有没有办法处理这种“大数据”?
我认为将整个 CSV 文件拆分为多个“较小”文件,然后将它们附加到另一个 CSV 文件,这是处理巨大 CSV 文件的正确方法吗?
【问题讨论】:
-
不完整。这可能取决于您阅读文件的方式。
-
@HenkHolterman 使用 python,尤其是在 Pandas 库中
标签: python csv encoding bigdata