【问题标题】:is it possible to customized Nutch Fetcher class?是否可以自定义 Nutch Fetcher 类?
【发布时间】:2016-03-30 11:02:48
【问题描述】:

我已成功抓取网页链接并将数据索引到 solr。
但我需要为所有将被抓取并索引到 Solr 的链接创建一个 pdf 文件。 我知道幻影会给我 pdf,但我不明白我在 Nutch 中配置幻影的位置。 我搜索了一下,我知道我需要自定义 Nutch 的 Fetcher 类,但我不知道如何自定义它。 请任何人都可以提供帮助。从过去的两周开始,我一直坚持这一点。

【问题讨论】:

  • 您能否再澄清一下,很难理解您在这里要完成什么任务。你想要一个到目前为止你爬过的所有url的列表吗?
  • @SujenShah 我想为所有将被 nutch 抓取的 url 创建 pdf。所以我需要知道我需要更改哪个类,以便它会创建 pdf。(我正在使用 phantomjs 来创建 pdf)。因为我只知道我需要将代码放在任何类中以创建 pdf,但直到现在我还没有找出类。

标签: java solr web-crawler phantomjs nutch


【解决方案1】:

您是否考虑过将 crawldb 转储为 csv 格式?我认为您可以在不修改任何代码并遵循以下内容的情况下完成您的任务(我的理解是获取 Nutch 抓取的所有 url 的列表)。

你可以使用./bin/nutch readdb <crawldb path> -dump <output_dir> -format csv

此命令将为您提供在 Nutch 中获取/未获取的所有 url。 将其保存在 csv 中后,您可以轻松地将其导出为 pdf。

有关该命令的更多信息,请查看https://wiki.apache.org/nutch/bin/nutch%20readdb

【讨论】:

  • 实际上我的任务是我需要为所有将被 nutch 抓取的 URL 创建 pdf 文件,并且在创建 URL 的 pdf 时,我需要将该 PDF 路径存储到 HBASE 中,并将其索引到索尔。
猜你喜欢
  • 1970-01-01
  • 2016-09-27
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-08-24
  • 1970-01-01
  • 1970-01-01
  • 2020-10-02
相关资源
最近更新 更多