【问题标题】:Getting AJAX content with Python Selenium and PhantomJS使用 Python Selenium 和 PhantomJS 获取 AJAX 内容
【发布时间】:2013-06-06 15:45:14
【问题描述】:

我正在编写一个爬虫,它需要等待所有 AJAX 加载的 HTML 内容,然后从中提取任何锚标记。当我调用 webdriver.get(URL) 时,我不确定它是否真的在等待将一些 AJAX 内容添加到 DOM。我可以按照文档here 中的定义进行某种隐式或显式等待。然而,即使在等待之后,webdriver.page_source 还是和等待之前一样。反正有没有等待后可以将AJAX内容拿到webdriver.page_source中,这样我就可以分析异步插入的内容了?

【问题讨论】:

  • webdriver.page_source is the same as it was before waiting -> 这几乎肯定意味着您没有正确使用显式等待。如果元素在 DOM 中,您将在页面源中看到它。我敢打赌,您的元素路径不够窄,并且正在 DOM 中拾取其他东西。

标签: python selenium web-crawler selenium-webdriver phantomjs


【解决方案1】:

我会检查您知道在 HTML DOM 中异步加载的某个元素是否存在。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-10-28
    • 1970-01-01
    • 2016-12-12
    • 2012-02-11
    • 2014-09-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多