【发布时间】:2013-05-05 05:54:57
【问题描述】:
这不是关于 javascript 修改页面源的某些部分的标准问题之一,这些部分在您右键单击 > 查看页面源后变得隐藏。我的问题不一样。
实际上,当我右键单击>查看页面源代码时,我可以看到整个 html 代码,但是当我尝试通过 BeautifulSoup、xml.parser 或什至使用 mechanize 打开它时,此时页面变得有点不同,并且缺少重要内容。
我可以得到这个真正的 html 代码的唯一方法是手动复制/粘贴整个内容并保存为文件。当我使用 python 自动执行此操作时,内容也会发生变化。
该网站基本上是 html 格式,但也看到了一些 javascript、flash 和 ajax 代码。
你们有什么想法可以做什么吗?我知道如果没有真正看到源代码可能很难弄清楚,但我想我最好不要发布我正在抓取的页面网址。
【问题讨论】:
-
在获取生成的 DOM 之前,您是否尝试过使用 pypi.python.org/pypi/python-spidermonkey 执行页面中的 JS 代码?
-
不,实际上我没有。感谢您的链接。
标签: python web-scraping