【发布时间】:2019-06-24 03:05:41
【问题描述】:
一些孟加拉语字符,例如“ৎ”、“।”当我尝试解析下面的 xml 文件“temp.xml”时显示 ParseError:
<?xml version="1.0" encoding="UTF-8"?>
<doc>
<WORD>
<অ>
<অসুখে>অসুখ</অসুখে>
<অসৎকে>অসৎ</অসৎকে>
</অ>
</WORD>
</doc>
使用python解析它:
import xml.etree.ElementTree as ET
trees = ET.parse('temp.xml')
roots = trees.getroot()
给出错误:
File "<string>", line unknown
ParseError: not well-formed (invalid token): line 6, column 11
错误是针对 xml 文件的行(对于 'ৎ' 字符):
<অসৎকে>অসৎ</অসৎকে>
如何解析这些字符?
【问题讨论】:
标签: python xml xml-parsing elementtree