【问题标题】:How to parse a document using crawler4j如何使用 crawler4j 解析文档
【发布时间】:2015-03-19 17:51:31
【问题描述】:

我想解析所有包含我在 Eclipse 中使用 crawler4j 作为“查询”输入的文本的文档。

有什么想法吗?

【问题讨论】:

    标签: search web web-crawler crawler4j


    【解决方案1】:

    这不是一个“直接”的答案,但最近几天我也在玩爬行。我首先查看了 Crawler4J,然后偶然发现了 JSoup。爬虫没怎么玩,但结果证明 jSoup 是一个非常简单的解析工具。因此我的建议。如果您真的需要爬取网络的一部分,我想爬虫很好。但是 JSoup 似乎确实是一个出色的解析器。在选择节点等方面类似于 JQuery ......所以也许使用爬虫首先收集文档,然后使用 JSoup 解析它们。这是一个简单的例子:

        Document doc = Jsoup.connect("http://example.com").userAgent("Mozilla").timeout(5000)
                .get();
        Elements els = doc.select("li");
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-05-04
      • 2016-03-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-12-10
      • 1970-01-01
      • 2017-04-30
      相关资源
      最近更新 更多