【发布时间】:2016-01-28 18:54:09
【问题描述】:
我实际上是在用 Java 开发一个文本解析器,我被要求通过解析 HTML 来增强它。 解析器的目的是将解析后的文件分成3个其他文件,一个包含文件中包含的所有单词,一个包含所有句子,另一个包含所有问题。
*.txt 部分完美运行,但我在解析 HTML 时遇到问题。
我创建了一个带有 *.txt 扩展名的临时文件并将其传递到我的文本解析器中,但如果我传递一个带有 HTML 文件链接的 URL,其格式如下:
<!DOCTYPE html>
<head>
... some HTML here ...
</head>
<body>
<ul class="some_menu">
<li class="some_menu_item">n1</li>
<li class="some_menu_item">n2</li>
<li class="some_menu_item">n2</li>
</ul>
<div>
This is a question ?
This is a sentence .
... some other text ...
</div>
</body>
</html>
问题文件将填写:n1 n2 n3 This is a question
所以,我只是想知道,有没有办法通过标签来解析 JSoup 标签,这样我就可以在每次关闭块时添加换行符?
如果您需要一些新信息,请不要问!
编辑:我应该有 3 个输出文件,对于这个例子来说:
-
一字一句
n1 n2 n3 This is a question sentence ... some other words ... -
一个包含所有句子
This is a sentence -
一个回答所有问题
This is a question
蒂米M
【问题讨论】:
-
是的,您可以逐个遍历标签并分别获取文本。但是,我真的不明白你在这里想要做什么。你能举个例子说明你想从这个 HTML 中得到什么吗?