【发布时间】:2018-03-02 14:06:48
【问题描述】:
我正在使用 Nutch 2.3.1 和 MongoDB 来实现持久性。我的目标是在不下载的情况下提取文件 URL。
现在它正在下载文件。如何禁用下载并将 URL 仅保留在数据库中?
如何从 Nutch2 中提取所有已抓取的 URL?
【问题讨论】:
标签: mongodb apache web-crawler nutch
我正在使用 Nutch 2.3.1 和 MongoDB 来实现持久性。我的目标是在不下载的情况下提取文件 URL。
现在它正在下载文件。如何禁用下载并将 URL 仅保留在数据库中?
如何从 Nutch2 中提取所有已抓取的 URL?
【问题讨论】:
标签: mongodb apache web-crawler nutch
根据您想要完成的任务,这可能需要一些修改:
如果您不想从 PDF 文件中解析/提取文本,那么您可以为 http.content.limit 设置一个较低的值,这基本上会阻止 Nutch 下载超过您在此处指定的字节数,但仍然会能够发现文件的 URL,并将下载一个片段(您指定的字节数)。
当然,这也会影响您要获取/下载的其他 URL。
一种方法是编写您自己的协议插件,以防止您下载任何 PDF 文件。
【讨论】: