【问题标题】:Nutch failed to crawl particular siteNutch 无法抓取特定网站
【发布时间】:2012-03-26 04:24:32
【问题描述】:

我正在使用 nutch 1.4 来抓取网站。出于演示目的,我开始使用 jabong.com 进行爬网,但我发现 nutch 无法获取网站中的所有链接。

访问后http://www.jabong.com/women/clothing/womens-suits-sets/ 它不会获取此站点中存在的映射在图像上的链接。

我已将 nutch 配置为:- conf/nuth-default.xml ---> 添加代理名称 conf/regex-urlfilter.txt ---> 而不是 +。 ,我写了 +^http://([a-z0-9]*.)*jabong.com/ seed.txt 包含http://www.jabong.com/

谁能告诉我它没有获取所有链接可能是什么问题?

【问题讨论】:

    标签: web-crawler nutch


    【解决方案1】:

    终于,在我头疼了很久之后,能够解决这个问题。所以在这里分享:) 你必须调整conf目录下nutch-default.xml定义的参数

    所以检查max.content.length,为此定义的值将在 60K 左右,但实际上页面内容要多得多,因此它无法爬取整个页面,这就是链接无法显示在爬取页面中的原因。

    因此,在抓取任何网站之前,请务必检查这些参数 :) 享受爬行:)

    PS:很抱歉,我觉得有些人觉得我在这里发布问题,然后发布解决方案。在发布问题之前,我实际上尝试了很多..

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-08-04
      • 1970-01-01
      • 2014-06-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多