这里的问题是,XML 中唯一有效的助记实体是 quot、amp、apos、lt 和 gt。这意味着几乎所有 (X)HTML 命名实体都必须使用在 XML 1.1 spec 中定义的 entity declaration markup 在 DTD 中定义。如果文档是独立的,则应使用内联 DTD 来完成,如下所示:
<?xml version="1.1" ?>
<!DOCTYPE naughtyxml [
<!ENTITY nbsp " ">
<!ENTITY copy "©">
]>
<data>
<country name="Liechtenstein">
<rank>1 ></rank>
<year>2008©</year>
<gdppc>141100</gdppc>
<neighbor name="Austria" direction="E"/>
<neighbor name="Switzerland" direction="W"/>
</country>
</data>
xml.etree.ElementTree 中的XMLParser 使用xml.parsers.expat 进行实际解析。在XMLParser 的初始参数中,有一个空格用于“predefined HTML entities”,但该参数尚未实现。在 init 方法中创建了一个名为 entity 的空字典,用于查找未定义的实体。
我不认为 expat(通过扩展,ET XMLParser)能够处理将命名空间切换到 XHMTL 之类的东西来解决这个问题。可能是因为它不会获取外部命名空间定义(我尝试将 xmlns="http://www.w3.org/1999/xhtml" 设为数据元素的默认命名空间,但效果不佳)但我无法确认。默认情况下,expat 会针对非 XML 实体引发错误,但您可以通过定义外部 DOCTYPE 来解决这个问题 - 这会导致 expat 解析器将未定义的实体条目传递回 ET.XMLParser 的 _default() 方法。
_default() 方法在XMLParser 实例中查找entity dict,如果找到匹配的键,它将用关联的值替换实体。这维护了问题中提到的 Python-2.x 语法。
解决方案:
- 如果数据没有外部 DOCTYPE 并且有 (X)HTML 助记符实体,那么您就不走运了。它不是有效的 XML,expat 抛出错误是正确的。您应该添加一个外部 DOCTYPE。
- 如果数据具有外部 DOCTYPE,您可以使用旧语法将助记符名称映射到字符。 注意:您应该在 py3k 中使用
chr() - unichr() 不再是有效名称
- 或者,您可以将
XMLParser.entity 更新为 html.entities.html5 以将所有有效的 HTML5 助记符实体映射到它们的字符。
- 如果数据是 XHTML,您可以继承
HTMLParser 来处理助记符实体,但这不会根据需要返回 ElementTree。
这是我使用的 sn-p - 它通过 HTMLParser(演示如何通过子类化添加实体处理)使用外部 DOCTYPE 解析 XML,使用实体映射的 ET.XMLParser 和 expat(只会静默由于外部 DOCTYPE 而忽略未定义的实体)。有一个有效的 XML 实体 (&gt;) 和一个未定义的实体 (&copy;),我使用 ET.XMLParser 映射到 chr(0x24B4)。
from html.parser import HTMLParser
from html.entities import name2codepoint
import xml.etree.ElementTree as ET
import xml.parsers.expat as expat
xml = '''<?xml version="1.0"?>
<!DOCTYPE data PUBLIC "-//W3C//DTD XHTML 1.0 Strict//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-strict.dtd">
<data>
<country name="Liechtenstein">
<rank>1></rank>
<year>2008©</year>
<gdppc>141100</gdppc>
<neighbor name="Austria" direction="E"/>
<neighbor name="Switzerland" direction="W"/>
</country>
</data>'''
# HTMLParser subclass which handles entities
print('=== HTMLParser')
class MyHTMLParser(HTMLParser):
def handle_starttag(self, name, attrs):
print('Start element:', name, attrs)
def handle_endtag(self, name):
print('End element:', name)
def handle_data(self, data):
print('Character data:', repr(data))
def handle_entityref(self, name):
self.handle_data(chr(name2codepoint[name]))
htmlparser = MyHTMLParser()
htmlparser.feed(xml)
# ET.XMLParser parse
print('=== XMLParser')
parser = ET.XMLParser()
parser.entity['copy'] = chr(0x24B8)
root = ET.fromstring(xml, parser)
print(ET.tostring(root))
for elem in root:
print(elem.tag, ' - ', elem.attrib)
for subelem in elem:
print(subelem.tag, ' - ', subelem.attrib, ' - ', subelem.text)
# Expat parse
def start_element(name, attrs):
print('Start element:', name, attrs)
def end_element(name):
print('End element:', name)
def char_data(data):
print('Character data:', repr(data))
print('=== Expat')
expatparser = expat.ParserCreate()
expatparser.StartElementHandler = start_element
expatparser.EndElementHandler = end_element
expatparser.CharacterDataHandler = char_data
expatparser.Parse(xml)