【问题标题】:Get all Pdf file Urls with Nutch2使用 Nutch2 获取所有 Pdf 文件 Url
【发布时间】:2018-03-02 14:06:48
【问题描述】:

我正在使用 Nutch 2.3.1 和 MongoDB 来实现持久性。我的目标是在不下载的情况下提取文件 URL。

现在它正在下载文件。如何禁用下载并将 URL 仅保留在数据库中?

如何从 Nutch2 中提取所有已抓取的 URL?

【问题讨论】:

    标签: mongodb apache web-crawler nutch


    【解决方案1】:

    根据您想要完成的任务,这可能需要一些修改:

    如果您不想从 PDF 文件中解析/提取文本,那么您可以为 http.content.limit 设置一个较低的值,这基本上会阻止 Nutch 下载超过您在此处指定的字节数,但仍然会能够发现文件的 URL,并将下载一个片段(您指定的字节数)。

    当然,这也会影响您要获取/下载的其他 URL。

    一种方法是编写您自己的协议插件,以防止您下载任何 PDF 文件。

    【讨论】:

      猜你喜欢
      • 2011-07-30
      • 1970-01-01
      • 2014-02-28
      • 1970-01-01
      • 2017-06-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-01-21
      相关资源
      最近更新 更多