【发布时间】:2016-03-06 16:04:31
【问题描述】:
我想从网页中提取 HTML:
import urllib2
req = urllib2.Request('https://www.example.com')
response = urllib2.urlopen(req)
fullhtml = response.read()
我尝试使用“ulrllib2”,但由于页面是动态构建的,因此 HTML 内容为空。
有没有办法等待 javascript 加载?
【问题讨论】:
-
使用执行 javascript 的爬虫或手动识别加载的部分(url)并获取它们。
-
urllib2 或 Python 核心中的任何其他内容都不会在任何地方执行 javascript
标签: python web-scraping web-crawler urllib2