【发布时间】:2019-01-17 09:18:24
【问题描述】:
我要编写数百个爬虫来爬取不同的静态网页,所以我选择 Scrapy 来帮助我完成我的工作。
在工作中,我发现大多数网站都很简单,不反蜘蛛。但是我发现很难在scrapy.setting.py 文件中设置西装DOWNLOAD_DELAY。有太多蜘蛛要编码,为每个蜘蛛找到合适的DOWNLOAD_DELAY 会让我没时间。
我想知道scrapy加载和使用DOWNLOAD_DELAY参数的型号,以及如何编写程序以在检测服务错误时自动增加DOWNLOAD_DELAY(蜘蛛请求过于频繁)。
【问题讨论】:
-
如果你的爬虫足够强大,可以将一个网站抱死,你应该从一个更合理的延迟开始:)
标签: web-scraping scrapy web-crawler delay