【发布时间】:2014-07-16 04:31:19
【问题描述】:
我正在尝试使用以下 BS4 代码抓取网页:
url = "http://www.xyz.con/abc.html"
#url2 = "file:///C:/Users/abc.html"
response = urllib2.urlopen(url)
html = response.read()
soup = BeautifulSoup(html)
myuls = soup.findAll("ul",{ "class" : "ctlg-holder"})
mya = myuls[0].findAll("a")
问题是,以下代码在在线页面上返回253个链接,但是当我将页面保存在我的计算机中并使用本地url2时,它返回342个链接(正确)
为什么我的代码只适用于本地保存的页面 (url2)?为什么它没有在 http url 上返回正确的答案?
【问题讨论】:
-
页面可以在浏览器中使用javascipt生成额外的数据。
-
@furas:有什么解决方法吗?我真的不在乎 JS 部分。
标签: python-2.7 web-scraping beautifulsoup