【发布时间】:2016-03-30 11:02:48
【问题描述】:
我已成功抓取网页链接并将数据索引到 solr。
但我需要为所有将被抓取并索引到 Solr 的链接创建一个 pdf 文件。
我知道幻影会给我 pdf,但我不明白我在 Nutch 中配置幻影的位置。
我搜索了一下,我知道我需要自定义 Nutch 的 Fetcher 类,但我不知道如何自定义它。
请任何人都可以提供帮助。从过去的两周开始,我一直坚持这一点。
【问题讨论】:
-
您能否再澄清一下,很难理解您在这里要完成什么任务。你想要一个到目前为止你爬过的所有url的列表吗?
-
@SujenShah 我想为所有将被 nutch 抓取的 url 创建 pdf。所以我需要知道我需要更改哪个类,以便它会创建 pdf。(我正在使用 phantomjs 来创建 pdf)。因为我只知道我需要将代码放在任何类中以创建 pdf,但直到现在我还没有找出类。
标签: java solr web-crawler phantomjs nutch