【问题标题】:Best way to get around web crawl throttling for Amazon.com解决 Amazon.com 网络爬取限制的最佳方法
【发布时间】:2014-04-08 06:09:01
【问题描述】:

我有一个每天运行的进程,它会在亚马逊上抓取电影价格列表。由于亚马逊并未在其产品搜索 API 中公开所有价格,因此网络爬取是获取 ASIN 的唯一方法,然后基于 ASIN 使用其产品搜索 API 来获取价格。

然而,在数千次网络爬取之后,亚马逊开始限制并抛出一个验证码页面,我无法再从中解析 A​​SIN。

我认为一个好的解决方案是切换 IP 以绕过限制。我的服务在 Heroku 上运行 rails,有没有实现 IP 切换的好方法?

【问题讨论】:

  • 同时更改用户代理字符串。
  • 有ip轮换服务,查看proxymesh和crawlera

标签: ruby-on-rails-3 heroku amazon web-crawler throttling


【解决方案1】:

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-03-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-04-08
    • 2017-10-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多