【发布时间】:2018-01-12 02:22:57
【问题描述】:
我是 python 和数据科学的新手,我想知道处理我的 csv 文件的最佳方法是什么。 我有一个 50.000 行和 2.000 列的 csv - 30.000Kb。 到目前为止,我的 python 程序并没有花很长时间阅读它;但我担心消耗这么多内存并使我的程序变慢。
目前我正在使用 pandas 读取文件:
pd.read_csv( tf.gfile.Open(pathA), sep=None, skipinitialspace=True, engine="python")
我的问题是:
- 我应该实施优化技术还是我的 csv 不是那么大?
-
我应该使用什么样的技术?
- 我读到我可以像这样分批阅读:with open(filename, 'rb') as f ...
- 我应该批量读取并将数据保存在内存中还是
- 我是否应该始终从文件中读取而不将数据保存在内存中
感谢您的回答 =)
【问题讨论】:
-
问题有点模糊...这取决于您的需求,文件的尺寸等...
-
您可能需要查看dask framework。我经常阅读超过 100 mb 的 csv 文件(虽然列数更少。这没有任何问题。一般来说:内存是可以使用的,所以如果你没有遇到任何问题,请使用该内存;)跨度>
标签: python pandas csv tensorflow data-science