【发布时间】:2019-11-14 15:25:52
【问题描述】:
我正在尝试打开一个包含 4605227 行 (305 MB) 的 txt 文件
我之前的做法是:
data = np.loadtxt('file.txt', delimiter='\t', dtype=str, skiprows=1)
df = pd.DataFrame(data, columns=["a", "b", "c", "d", "e", "f", "g", "h", "i"])
df = df.astype(dtype={"a": "int64", "h": "int64", "i": "int64"})
但它用尽了大部分可用内存 ~10GB 并且没有完成。 有没有更快的方法来读取这个 txt 文件并创建一个 pandas 数据框?
谢谢!
编辑: 现在解决了,谢谢。为什么 np.loadtxtx() 这么慢?
【问题讨论】:
-
df = pd.read_csv9('file.txt', delimiter='\t', dtype=str, skiprows=1)会发生什么? -
stackoverflow.com/questions/25962114/…,标签问题中的6gb文件
-
同意@QuangHoang 305 MB 应该可以直接用 pandas 读取
标签: python python-3.x pandas numpy