【问题标题】:How to hide the continuous hit rates(Refresh) to a website如何隐藏网站的连续点击率(刷新)
【发布时间】:2018-06-11 23:16:22
【问题描述】:

我开发了一个 Python(请求)和 Java 代码来从网站上抓取数据。它将通过不断刷新网站以获取新数据来工作。
但是该网站最近将我的爬虫识别为自动化服务,并且我的帐户已被锁定。有没有办法隐藏这种刷新以获取新数据而无需帐户锁定?

【问题讨论】:

    标签: web-scraping scrapy python-requests scrapy-spider pyspider


    【解决方案1】:

    这取决于它是哪个网站,无论如何,爬虫模拟用户行为,仍然会被阻止。
    如果网站检测到定时任务,解决方案可能是随机化应用程序的刷新时间。
    如果网站会显示验证码,您没有简单的解决方案
    如果网站只统计特定IP地址的访问,你可以设置一个动态代理服务器来模拟来自其他IP的请求

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2022-12-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-04-09
      • 1970-01-01
      相关资源
      最近更新 更多