【发布时间】:2014-05-09 01:32:54
【问题描述】:
这是我的python代码:
import urllib2
from bs4 import BeautifulSoup
page = urllib2.urlopen("http://www.amazon.com/")
soup = BeautifulSoup(page)
print soup
它适用于 google.com 和许多其他网站,但不适用于 amazon.com。
我可以在浏览器中打开 amazon.com,但生成的“汤”仍然没有。
此外,我发现它也无法从 appannie.com 抓取。但是,代码不会给出任何内容,而是返回错误:
HTTPError: HTTP Error 503: Service Temporarily Unavailable
所以我怀疑亚马逊和 App Annie 是否会阻止抓取。
【问题讨论】:
-
同样的代码适用于我,我只是在 amazon.com 周围添加了引号
-
我不知道为什么google.com 对我有用,但amazon.com 却不行。
-
它甚至会在您的浏览器中打开吗?
-
我可以在浏览器中打开它,所以我怀疑亚马逊是否会阻止抓取。
标签: python beautifulsoup amazon