【发布时间】:2014-04-08 06:09:01
【问题描述】:
我有一个每天运行的进程,它会在亚马逊上抓取电影价格列表。由于亚马逊并未在其产品搜索 API 中公开所有价格,因此网络爬取是获取 ASIN 的唯一方法,然后基于 ASIN 使用其产品搜索 API 来获取价格。
然而,在数千次网络爬取之后,亚马逊开始限制并抛出一个验证码页面,我无法再从中解析 ASIN。
我认为一个好的解决方案是切换 IP 以绕过限制。我的服务在 Heroku 上运行 rails,有没有实现 IP 切换的好方法?
【问题讨论】:
-
同时更改用户代理字符串。
-
有ip轮换服务,查看proxymesh和crawlera
标签: ruby-on-rails-3 heroku amazon web-crawler throttling