【问题标题】:Scraping this website using python使用 python 抓取这个网站
【发布时间】:2018-02-01 05:20:42
【问题描述】:

我是网络抓取的新手,并试图抓取以下网站: https://www.epri.com/#/careers/list

我正在尝试使用 python 进行抓取。我尝试过请求、PhantomJS、selenium chromedriver 来获取 html。但是我得到的 html 与我在使用谷歌浏览器检查时看到的 html 不匹配。

我对抓取非常陌生,对 html 的了解很少,对 JavaScript 几乎一无所知。我的主要难题是获取我在 google chrome 中看到的 html,这样我就可以开始抓取了。

提前致谢!

【问题讨论】:

标签: javascript python


【解决方案1】:

您首先应该寻找的是 DOM 解析器。这些可以帮助您将 DOM 对象(如 <body><head><img> 等)视为 python 对象。 Python DOM parser

完成此操作后,您应该编写一个获取整个 html 的程序,然后使用 DOM 解析器从 python 中获取您需要的信息。如果你需要抓取不同的页面,比如很多链接,你应该将它们存储在一个数组中,获取它们的 HTML 并重复这个过程。

通过这种方式,您可以获得任何网站的大部分信息。你应该做的是逆向工程如何得到它。

【讨论】:

    【解决方案2】:

    urllib2 非常适合此目的。它也很容易使用。

    import urllib2
    URL = 'https://www.epri.com/#/careers/list'
    response = urllib2.urlopen(URL)
    print "Output: \n\n\n\n", response.read()
    

    解析得到的HTML,可以使用BeautifulSoup。

    【讨论】:

    • 这不按我想要的方式工作。生成的 html 不是我在 google chrome 中看到的。 html是动态生成的。
    【解决方案3】:

    您可以使用pyquery,它允许您对 xml 文档进行 jquery 查询。

    【讨论】:

      猜你喜欢
      • 2020-09-28
      • 1970-01-01
      • 2022-06-10
      • 2016-05-27
      • 1970-01-01
      • 2016-10-14
      • 2014-11-23
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多