【发布时间】:2016-02-02 16:45:54
【问题描述】:
我试图使用 Scrapy 来抓取一些网站上大约 70k 个项目。但是每次抓取大约 200 个项目后,其余的都会弹出错误:
scrapy] DEBUG: Ignoring response <404 http://www.somewebsite.com/1234>: HTTP status code is not handled or not allowed
我相信这是因为我的蜘蛛被网站屏蔽了,我尝试使用随机用户代理建议here,但它根本没有解决问题。有什么好的建议吗?
【问题讨论】:
-
对我来说,这种情况下最好的解决方法是使用
Kimono Labs,你可以从字面上抓取任何东西并创建一个 API,让他们担心禁止你获取 JSON 数据的情况,你可以简单地通过打他们的 API
标签: python scrapy scrapy-spider scrapy-pipeline