【发布时间】:2013-12-13 02:44:17
【问题描述】:
您能从这个webpage 中提取 VIN 号码吗?
我尝试了urllib2.build_opener、请求和机械化。我也提供了用户代理,但他们都看不到 VIN。
opener = urllib2.build_opener()
opener.addheaders = [('User-agent',('Mozilla/5.0 (Macintosh; Intel Mac OS X 10_6_7) ' 'AppleWebKit/535.1 (KHTML, like Gecko) ' 'Chrome/13.0.782.13 Safari/535.1'))]
page = opener.open(link)
soup = BeautifulSoup(page)
table = soup.find('dd', attrs = {'class': 'tip_vehicleStats'})
vin = table.contents[0]
print vin
【问题讨论】:
-
你得到了什么?整个页面?
-
我得到了一个空的跨度类,但实际上应该有 VIN 号。在浏览器中检查元素时可以看到它。
-
@TeodorScorpan 它是使用 Javascript 动态创建的。
-
你是说我没办法废掉它?
-
测试某些内容是否正常可抓取的好方法是在关闭 JavaScript 的情况下在浏览器中查看它。
标签: python web-scraping beautifulsoup urllib2 mechanize