【发布时间】:2011-12-15 23:05:21
【问题描述】:
我正在使用 Python 的 Mechanize 模块。我遇到了 3 个不同的网站,它们无法通过机械化直接打开:
- en.wikipedia.org/wiki/Dog(新用户,不能发布超过 2 个链接 T-T)
- https://www.google.com/search?num=100&hl=en&site=&q=dog&oq=dog&aq=f&aqi=g10&aql=1&gs_sm=e&gs_upl=618l914l0l1027l3l2l0l0l0l0l173l173l0.1l1l0
-
http://www.cpsc.gov/cpscpub/prerel/prhtml03/03059.html
import mechanize br = mechanize.Browser() br.set_handle_robots(False)
添加以下代码允许 mechanize 打开并解析维基百科文章和 google 搜索结果:
br.addheaders = [('User-agent', 'Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.9.0.1) Gecko/2008071615 Fedora/3.0.1-1.fc9 Firefox/3.0.1')]
但是,我的解决方法与 CPSC.gov 网站不匹配 - 当我尝试使用 mechanize Browser 打开它时,我的 python 冻结了 - 以至于我什至无法通过键盘中断它。
这是怎么回事?
【问题讨论】: