【发布时间】:2016-03-01 04:51:27
【问题描述】:
我正在使用 nutch 2.3.1
我执行了爬取网站的命令:
- ./nutch 注入 ../urls/seed.txt
- ./nutch 生成 -topN 2500
- ./nutch fetch -all
问题是,nutch 只抓取第一个 URL(在seeds.txt 中指定的那个)。数据只是来自第一个 URL/页面的 HTML。
generate 命令累积的所有其他 URL 都没有真正被爬取。
我无法让 nutch 抓取其他生成的网址...我也无法让 nutch 抓取整个网站。 我需要使用哪些选项来抓取整个网站?
有人有什么见解或建议吗?
非常感谢您的帮助
【问题讨论】:
标签: apache web-crawler nutch