【问题标题】:Apache NUTCH, relevant crawlingApache NUTCH,相关爬取
【发布时间】:2014-11-19 16:33:17
【问题描述】:

我正在使用 Apache NUTCH 2.2.1 抓取网站,它为我提供了在 SOLR 上进行索引的内容。当 NUTCH 获取内容时,有一些上下文信息,例如“联系我们”、“法律声明”或其他一些我不需要索引的无关信息(通常来自上部菜单、左侧菜单或页面页脚)。

其中一种解决方案是自动选择内容中最相关的部分进行索引,这可以通过自动摘要器完成。有一个插件“summary-basic”,是否用于此目的?如果是这样,它是如何配置的?也欢迎其他解决方案。

【问题讨论】:

    标签: apache web-crawler nutch


    【解决方案1】:

    在 regex-urlfilter.txt 中,您可以指定要忽略的 url 列表。您可以在该正则表达式列表中为“联系我们”(通常是您不想抓取的所有页眉、页脚信息)等指定 http 链接。在抓取网页时,nutch 将忽略这些 url,并且只会获取所需的内容。您可以在 apache-nutch-2.2.1/conf 文件夹下找到 regex-urlfilter.txt

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-06-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多