【问题标题】:Integrating Nutch web-crawling functionality into a Java application将 Nutch 网络爬虫功能集成到 Java 应用程序中
【发布时间】:2016-06-01 10:34:08
【问题描述】:

我会在我的 Java 应用程序中使用 Apache Nutch 来抓取一个或多个网站的网页。基本上,我需要为网络爬虫找到的每个网页调用我的 Java 应用程序的一个方法,以便处理页面内容(文本等)。如何做到这一点?

【问题讨论】:

标签: java web-crawler nutch


【解决方案1】:

好吧,您的问题似乎是 "XY Problem",Nutch 可以用作您的自定义 Java 应用程序中的库,bin/nutch 和 bin/crawl 脚本基本上只是使用正确的参数执行几个 Java 类,所以在您的应用程序可以使用正确的参数调用正确的类,查看bin/crawl 脚本将为您提供正确的步骤(和类)序列来调用完整的循环爬网。这应该只用于小型爬网。

现在,回到 XY 问题,如果您只需要从网页中提取自定义文本/元数据,您可以扩展 Nutch 本身,而无需编写自定义应用程序。根据您的描述,您似乎在使用自定义解析器/索引插件。如果是这种情况,我建议查看标题插件 (https://github.com/apache/nutch/tree/master/src/plugin/headings),这是编写自己的 HtmlParseFilter 插件的一个很好的起点。您仍然需要编写自定义代码,但它将包含在 Nutch 插件中。

您也可以查看https://issues.apache.org/jira/browse/NUTCH-1870,此插件允许使用 XPath 表达式提取 HTML 的自定义部分。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2019-08-12
    • 1970-01-01
    • 1970-01-01
    • 2011-05-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-01-24
    相关资源
    最近更新 更多