【发布时间】:2015-05-05 23:31:30
【问题描述】:
我需要解析一个编码为“ISO-8859-1”的 1.2GB XML 文件,在阅读了 NET 上的几篇文章后,似乎 Python 的 ElementTree 的 iterparse() 优于 SAX 解析。
我写了一段非常短的代码只是为了测试它,但它提示了一个我不知道如何解决的错误。
我的代码(Python 2.7):
from xml.etree.ElementTree import iterparse
for (event, node) in iterparse('dblp.xml', events=['start']):
print node.tag
node.clear()
编辑: 啊,因为文件真的很大而且很慢,我输入了 XML 行,然后出错了。它是“ü”没有空间。对此我深表歉意。
这段代码运行良好,直到它在 XML 文件中找到如下所示的一行:
<Journal>Technical Report 248, ETH Zürich, Dept of Computer Science</Journal>
我猜是苏黎世的意思,但解析器似乎不知道这一点。
运行上面的代码给了我一个错误:
xml.etree.ElementTree.ParseError: undefined entity ü
无论如何我可以解决这个问题吗?我用谷歌搜索了很多解决方案,但似乎没有一个能直接解决这个问题。
【问题讨论】:
-
好的,您遇到了需要解决的不一致问题。在 XML 中有
&umml,在错误中有&uuml。如果它们都是&umml,是因为 XML 无效,需要更正。如果它们都是&uuml,那么 is 是一个已定义的实体,那么应该可以工作。如果它们实际上不同,您需要提供有关该文件的更多信息。