【发布时间】:2013-01-05 23:29:03
【问题描述】:
我正在尝试使用 scrapy 抓取网站,但该网站没有站点地图或页面索引。如何用scrapy抓取网站的所有页面?
我只需要下载网站的所有页面而不提取任何项目。我只需要设置跟随蜘蛛规则中的所有链接吗?但是不知道scrapy会不会这样避免重复url。
【问题讨论】:
-
为什么不直接遍历网站上的所有链接然后爬走?
-
@enginefree 循环遍历所有链接是可行的方法,但我不知道如何用scrapy设置。
-
如果你不想废弃物品,那你为什么要使用scrapy。只需使用任何网站下载器,它就会为您完成一切
-
@user1937 我还有其他python代码来解析html响应
标签: python web-crawler scrapy scrape