【发布时间】:2018-04-04 13:11:32
【问题描述】:
我正在尝试访问其内容由 javascript 生成的元素中的文本。例如,从this site 获取 Twitter 分享的数量。
我尝试使用 urllib 和 pyqt 来获取页面的 html,但是由于内容需要生成 javascript,因此它的 HTML 不存在于 urllib/pyqt 的响应中。我目前正在使用 selenium 来完成这项任务,但是它花费的时间比我想要的要长。
是否可以在不打开浏览器页面的情况下访问这些数据?
这个问题过去已经被问过,但我发现的结果要么是c# specific,要么提供一个链接到自gone dead以来的解决方案
【问题讨论】:
-
Selenium 通常是最好的选择。除非您可以隔离获取数据的特定 javascript 请求
标签: javascript python html web-scraping