【发布时间】:2018-07-01 18:13:35
【问题描述】:
我正在尝试使用 python 和 BeautifulSoup 的网络抓取从博客中迁移一些 cmets。我正在寻找的内容不在 HTML 本身中,并且似乎是在脚本标签中生成的(我找不到)。我已经看到了一些关于此的答案,但其中大多数都特定于某个问题,我似乎无法弄清楚如何将它应用于我的网站。我只是想从这样的页面中抓取 cmets:
我也尝试过 Selenium,但我目前使用的是基于 Cloud9 的 IDE,它似乎不支持 Web 驱动程序。
如果我搞砸了任何术语,我深表歉意,我对编程很陌生。如果有人有任何提示,那将很有帮助。谢谢!
【问题讨论】:
-
使用 dryscrape 库。或者 phantomJS
-
使用 Selenium 是您最好的选择。我不关心您的 IDE,但我建议您将 IDE 更改为 Pycharm 或支持驱动程序的东西。
标签: javascript python json web-scraping beautifulsoup