【发布时间】:2010-11-11 11:09:27
【问题描述】:
我正在使用 elementtree.parse() 函数解析一些 XML。它可以工作,除了一些 utf-8 字符(128 以上的单字节字符)。我看到默认解析器是基于 expat 的 XMLTreeBuilder。
是否有我可以使用的替代解析器可能不那么严格并允许 utf-8 字符?
这是我在使用默认解析器时遇到的错误:
ExpatError: not well-formed (invalid token): line 311, column 190
导致这种情况的字符是单字节 x92(十六进制)。我不确定这甚至是一个有效的 utf-8 字符。但处理它会很好,因为大多数文本编辑器将其显示为:í
编辑:字符的上下文是:canít,我认为它应该是一个花哨的撇号,但在十六进制编辑器中,相同的序列是:63 61 6E 92 74
【问题讨论】:
标签: python xml utf-8 elementtree