【发布时间】:2018-02-01 05:20:42
【问题描述】:
我是网络抓取的新手,并试图抓取以下网站: https://www.epri.com/#/careers/list
我正在尝试使用 python 进行抓取。我尝试过请求、PhantomJS、selenium chromedriver 来获取 html。但是我得到的 html 与我在使用谷歌浏览器检查时看到的 html 不匹配。
我对抓取非常陌生,对 html 的了解很少,对 JavaScript 几乎一无所知。我的主要难题是获取我在 google chrome 中看到的 html,这样我就可以开始抓取了。
提前致谢!
【问题讨论】:
-
阅读dataquest.io/blog/web-scraping-tutorial-python。这将使您了解网络抓取(使用 Python)。
-
并非所有网站都有静态 html 内容,这可能是您所追求的。您拥有的那个网站看起来有些部分是生成的,而其他部分可能是 css。试试这个问题,stackoverflow.com/questions/8323728/…
-
美丽的肥皂为什么不用?
-
该页面似乎在请求
https://services.epri.com/api/page-data/reqs,这是填写未平仓头寸表的 JSON。
标签: javascript python