【问题标题】:Nutch not crawling entire websiteNutch 没有抓取整个网站
【发布时间】:2016-03-01 04:51:27
【问题描述】:

我正在使用 nutch 2.3.1

我执行了爬取网站的命令:

  • ./nutch 注入 ../urls/seed.txt
  • ./nutch 生成 -topN 2500
  • ./nutch fetch -all

问题是,nutch 只抓取第一个 URL(在seeds.txt 中指定的那个)。数据只是来自第一个 URL/页面的 HTML。

generate 命令累积的所有其他 URL 都没有真正被爬取。

我无法让 nutch 抓取其他生成的网址...我也无法让 nutch 抓取整个网站。 我需要使用哪些选项来抓取整个网站?

有人有什么见解或建议吗?

非常感谢您的帮助

【问题讨论】:

    标签: apache web-crawler nutch


    【解决方案1】:

    如果Nutch只抓取一个指定的URL,请检查Nutch过滤器(conf/regex-urlfilter.txt)。爬取种子中的所有URL,regex-urlfilter.txt的内容应该如下。

    # accept all URLs
    +.
    

    在此处查看详细信息:http://wiki.apache.org/nutch/NutchTutorial

    希望这会有所帮助,

    乐国岛

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-08-04
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-12-28
      • 1970-01-01
      相关资源
      最近更新 更多