【发布时间】:2016-03-21 00:56:29
【问题描述】:
我正在尝试从 google 和linkedin 抓取数据。不知何故,它给了我这个错误:
*** httperror_seek_wrapper: HTTP Error 503: Service Unavailable
有人可以帮助建议我如何解决这个问题吗?
【问题讨论】:
标签: error-handling web-scraping
我正在尝试从 google 和linkedin 抓取数据。不知何故,它给了我这个错误:
*** httperror_seek_wrapper: HTTP Error 503: Service Unavailable
有人可以帮助建议我如何解决这个问题吗?
【问题讨论】:
标签: error-handling web-scraping
Google 只是自动检测您的查询。您需要一个验证码求解器才能获得无限的结果。以下链接可能会有所帮助。
https://support.google.com/websearch/answer/86640?hl=en
使用 OCR 引擎绕过验证码:
http://www.debasish.in/2012/01/bypass-captcha-using-python-and.html
简单方法:
更简单的方法是简单地使用 sleep() 几次并生成随机查询。这样,谷歌就不会发现您正在使用自动化系统。但是系统要慢得多...
错误处理:
要简单地删除错误消息,请使用 try 和 except
【讨论】:
我遇到了同样的情况,并尝试在每个请求之前使用 sleep() 函数来分散请求。看起来它工作正常,但即使延迟 2 秒也很快就失败了。最终解决它的是使用:
with contextlib.closing(urllib.urlopen(urlToOpen)) as x:
#do stuff with x.
我这样做是因为我认为打开太多请求会使其保持打开状态并且不得不关闭。然而,它的工作非常一致,延迟时间少至 0.5 秒。
【讨论】: