【发布时间】:2012-03-26 04:24:32
【问题描述】:
我正在使用 nutch 1.4 来抓取网站。出于演示目的,我开始使用 jabong.com 进行爬网,但我发现 nutch 无法获取网站中的所有链接。
访问后http://www.jabong.com/women/clothing/womens-suits-sets/ 它不会获取此站点中存在的映射在图像上的链接。
我已将 nutch 配置为:- conf/nuth-default.xml ---> 添加代理名称 conf/regex-urlfilter.txt ---> 而不是 +。 ,我写了 +^http://([a-z0-9]*.)*jabong.com/ seed.txt 包含http://www.jabong.com/
谁能告诉我它没有获取所有链接可能是什么问题?
【问题讨论】:
标签: web-crawler nutch