【发布时间】:2013-06-06 15:45:14
【问题描述】:
我正在编写一个爬虫,它需要等待所有 AJAX 加载的 HTML 内容,然后从中提取任何锚标记。当我调用 webdriver.get(URL) 时,我不确定它是否真的在等待将一些 AJAX 内容添加到 DOM。我可以按照文档here 中的定义进行某种隐式或显式等待。然而,即使在等待之后,webdriver.page_source 还是和等待之前一样。反正有没有等待后可以将AJAX内容拿到webdriver.page_source中,这样我就可以分析异步插入的内容了?
【问题讨论】:
-
webdriver.page_source is the same as it was before waiting-> 这几乎肯定意味着您没有正确使用显式等待。如果元素在 DOM 中,您将在页面源中看到它。我敢打赌,您的元素路径不够窄,并且正在 DOM 中拾取其他东西。
标签: python selenium web-crawler selenium-webdriver phantomjs