【发布时间】:2018-06-11 23:16:22
【问题描述】:
我开发了一个 Python(请求)和 Java 代码来从网站上抓取数据。它将通过不断刷新网站以获取新数据来工作。
但是该网站最近将我的爬虫识别为自动化服务,并且我的帐户已被锁定。有没有办法隐藏这种刷新以获取新数据而无需帐户锁定?
【问题讨论】:
标签: web-scraping scrapy python-requests scrapy-spider pyspider
我开发了一个 Python(请求)和 Java 代码来从网站上抓取数据。它将通过不断刷新网站以获取新数据来工作。
但是该网站最近将我的爬虫识别为自动化服务,并且我的帐户已被锁定。有没有办法隐藏这种刷新以获取新数据而无需帐户锁定?
【问题讨论】:
标签: web-scraping scrapy python-requests scrapy-spider pyspider
这取决于它是哪个网站,无论如何,爬虫模拟用户行为,仍然会被阻止。
如果网站检测到定时任务,解决方案可能是随机化应用程序的刷新时间。
如果网站会显示验证码,您没有简单的解决方案
如果网站只统计特定IP地址的访问,你可以设置一个动态代理服务器来模拟来自其他IP的请求
【讨论】: