【发布时间】:2011-08-09 22:18:50
【问题描述】:
我正在构建一个蜘蛛,我正在使用 Beautiful soup 来解析特定 URL 的包含。 现在,一些站点正在使用 Java 脚本来显示动态内容,一旦发生某些操作 [单击或时间],就会向用户显示这些内容。 美丽的汤只解析 java-script 标签运行之前的静态包含。 我想要在 java-script 运行后包含。 有没有办法做到这一点?
我可以想到一种方法:获取 url,打开浏览器并运行此 URL 和 java-script 标签。然后把这个url传给Beautiful soup,可以看到包含哪个java-script[dynamic contains]产生了。但是,如果我要抓取数百万个链接,那么这个解决方案就没有用了。如果有一些可用的内置模块可以预先生成 Html 页面的动态包含。
【问题讨论】:
标签: python web-crawler beautifulsoup