【发布时间】:2015-10-26 21:07:47
【问题描述】:
我正在编写一个工具,他的一项操作应该是分析网页来源。
我正在使用 Selenium for Python 和 Firefox 驱动程序。
当我尝试使用webdriver.page_source 命令获取页面的源代码时,我得到的源代码与我从常规的源代码不同(在浏览器中右键单击-> 页面源代码)。
我使用挂钩到应该向页面添加文本的浏览器(我在常规页面源中看到了该文本,但无法通过 selenium 看到它)
例如:
来自浏览器的源代码:
<html>
<head></head>
<body>
<title>Title</title>
<h1>Test Page</h1>
<div>THIS DIV INJECTED TO THE BROWSER</div>
</body>
</html>
来自 Selenium 的源代码:
<html xmlns="http://www.w3.org/1999/xhtml">
<head></head>
<body>
<title>Title</title>
<h1>Test Page</h1>
</body>
</html>
我看到了类似的帖子here,但那里的答案不相关。
请注意,我需要 源代码 本身,而不是渲染的代码(我通过 webdriver.execute_script 获得。
如何获取常规源代码?
【问题讨论】:
-
不同的如何,究竟是什么?
-
抱歉,我现在编辑了问题。
-
...但它仍然没有真正回答我的问题。 minimal reproducible example 是必需的。