【发布时间】:2010-12-29 17:03:58
【问题描述】:
我对 SAX 和 Java 有疑问。
我正在解析 dblp 数字图书馆数据库 xml 文件(枚举期刊、会议、论文)。 XML 文件非常大(> 700MB)。
但是,我的问题是,当回调characters()返回时,如果检索到的字符串包含多个entities,该方法只返回从最后一个实体开始的字符串字符找到。
即:R&uuml;diger Mecke 是<author> 标签之间的原作者姓名
üdiger Mecke 是结果
(characters(ch[], start, length)方法返回的字符串。
我想知道:
- 如何防止 PArser 自动解析实体?
- 如何解决前面描述的截断字符问题?
【问题讨论】: