【发布时间】:2015-03-19 17:51:31
【问题描述】:
我想解析所有包含我在 Eclipse 中使用 crawler4j 作为“查询”输入的文本的文档。
有什么想法吗?
【问题讨论】:
标签: search web web-crawler crawler4j
我想解析所有包含我在 Eclipse 中使用 crawler4j 作为“查询”输入的文本的文档。
有什么想法吗?
【问题讨论】:
标签: search web web-crawler crawler4j
这不是一个“直接”的答案,但最近几天我也在玩爬行。我首先查看了 Crawler4J,然后偶然发现了 JSoup。爬虫没怎么玩,但结果证明 jSoup 是一个非常简单的解析工具。因此我的建议。如果您真的需要爬取网络的一部分,我想爬虫很好。但是 JSoup 似乎确实是一个出色的解析器。在选择节点等方面类似于 JQuery ......所以也许使用爬虫首先收集文档,然后使用 JSoup 解析它们。这是一个简单的例子:
Document doc = Jsoup.connect("http://example.com").userAgent("Mozilla").timeout(5000)
.get();
Elements els = doc.select("li");
【讨论】: