【发布时间】:2017-02-07 01:15:37
【问题描述】:
我试图从检查元素时出现的 HTML DOM 中获取特定元素,但由于某种原因,这是在查看没有执行 javascript 的纯 HTML 代码。有任何想法吗?我与其他人唯一不同的是,避免 403 错误的那一行。
import urllib2
from bs4 import BeautifulSoup as BS
#avoid 403 error
request = urllib2.Request(url, headers={'User-Agent' : "Mozilla/5.0"})
html = urllib2.urlopen(request).read()
soup = BS(html, 'html.parser')
print soup.find('div', {'class' : 'video'})
【问题讨论】:
-
发布网址或html代码
标签: javascript python html web-scraping beautifulsoup