【问题标题】:How to wait for the page to load before scraping it? [closed]如何在抓取页面之前等待页面加载? [关闭]
【发布时间】:2016-03-06 16:04:31
【问题描述】:

我想从网页中提取 HTML:

import urllib2
req = urllib2.Request('https://www.example.com')
response = urllib2.urlopen(req)
fullhtml = response.read()

我尝试使用“ulrllib2”,但由于页面是动态构建的,因此 HTML 内容为空。

有没有办法等待 javascript 加载?

【问题讨论】:

  • 使用执行 javascript 的爬虫或手动识别加载的部分(url)并获取它们。
  • urllib2 或 Python 核心中的任何其他内容都不会在任何地方执行 javascript

标签: python web-scraping web-crawler urllib2


【解决方案1】:

看看这个http://phantomjs.org/。大多数网站都是基于 javascript 的,php 或 python 无法执行它们。我认为这个库将是你能得到的最好的。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多