【发布时间】:2013-01-29 13:40:50
【问题描述】:
我正在 python 2.7 中读取一个 800 GB 的 xml 文件并使用 etree 迭代解析器对其进行解析。
目前,我只使用open('foo.txt') 没有缓冲参数。我有点困惑这是我应该采用的方法,还是应该使用缓冲参数或使用来自 io 的东西,例如 io.BufferedReader 或 io.open 或 io.TextIOBase。
我们将不胜感激。
【问题讨论】:
-
800GB 文本文件?!上帝之母...你们在什么时候想说将其放入数据库是个好主意?
-
@Makoto,更糟糕的是标题是文本,但正文却是 XML
-
我只是希望你的文件实际上是有效的 XML...
-
@JBernardo,也许他们必须这样做才能满足营销部门的流行语合规性。
-
如果你必须知道,它是西班牙语维基百科的完整修订转储。
标签: python xml python-2.7 file io