【发布时间】:2016-09-01 19:53:22
【问题描述】:
我尝试通过 Scrapy 抓取亚马逊。 但我有这个错误
DEBUG: Retrying <GET http://www.amazon.fr/Amuses-bouche-Peuvent-b%C3%A9n%C3%A9ficier-dAmazon-Premium-Epicerie/s?ie=UTF8&page=1&rh=n%3A6356734031%2Cp_76%3A437878031>
(failed 1 times): 503 Service Unavailable
我认为这是因为 = 亚马逊非常擅长检测机器人。 我怎样才能防止这种情况?
我在每次请求之前都使用了time.sleep(6)。
我不想使用他们的 API。
我尝试使用 tor 和 polipo
【问题讨论】:
-
tor + polipo 怎么样?有效吗?
-
@ji-ruh for amazon non
-
我投票决定将此问题作为题外话结束,因为它寻求的是政策合规性方面的帮助,而不是编程方面的帮助。
-
@TylerH 抓取公共数据并不违法,答案帮助我防止因更改 Scrapy 框架中的设置而被列入黑名单
-
刮刀绝对没有法律义务遵守网站的限制。抓取是not illegal。必须重新打开此答案。
标签: web-scraping scrapy web-crawler amazon scrapy-spider