【发布时间】:2016-09-24 12:35:46
【问题描述】:
我正在使用 python 3.5 (Beautifulsoup) 废弃一个网站。我可以阅读源代码中的所有内容,但我一直试图从 disqus 中检索嵌入式 cmets,但没有成功(这是对脚本的引用)。
这段 html 代码源如下所示:
var disqus_identifier = "node/XXXXX";
script type='text/javascript' src='https://disqus.com/forums/siteweb/embed.js';
src 发送到脚本函数。
我已经阅读了 stackoverflow 中的建议,使用 selenium,但我很难让它工作但没有成功。我知道 selenium 模拟浏览器(我认为这对我想要的来说太重了)。但是,我的 webdrivers 有问题,它不能正常工作。所以,我放弃了这个选项。
我希望能够执行脚本并使用 cmets 检索 .js。 我发现一个可能的解决方案是 PyV8。但我无法在 python 中导入。 我在互联网上阅读了帖子,我用谷歌搜索了它,但它不起作用。
我安装了 Sublime Text 3 并手动下载了 pyv8-win64-p3:
C:\Users\myusername\AppData\Roaming\Sublime Text 3\Installed Packages\PyV8\pyv8-win64-p3
但我不断得到:
ImportError: 没有名为“PyV8”的模块。
如果有人可以帮助我,我将非常感谢。
【问题讨论】:
-
我找到了一种方法。我足以构建指向嵌入框架的 url(在 java 脚本中完成的事情之一)并解析它。
标签: javascript python web-scraping pyv8