【发布时间】:2014-02-03 22:16:21
【问题描述】:
我有一个来自维基词典的巨大 xml 文件,我需要为一个类项目解析它。我只需要从一组 200 行中提取数据,这些行从第 395,000 行开始。我将如何只扫描那少量的行?行号是否有某种内置属性?
【问题讨论】:
-
XML 语义不包括文本行的概念,只包括元素和元素内容(文本字符串)。如果您必须在 Java 中执行此操作,最简单的方法是使用内置的 SAX 事件驱动解析器。您将输入作为元素开始/结束事件和文本节点的流处理,因此您可以快速阅读输入流并找到需要处理的内容。