【发布时间】:2012-01-20 06:53:36
【问题描述】:
我想编写一个抓取脚本来从 cnn 文章中检索 cmets。比如这篇文章:http://www.cnn.com/2012/01/19/politics/gop-debate/index.html?hpt=hp_t1
我意识到 cnn 使用 disqus 进行评论讨论。由于评论加载不是基于网页的(即上一页,下一页)并且是动态的(即需要单击“加载下一个25”),我不知道如何检索本文的所有5000+ cmets。
有什么想法或建议吗?
非常感谢!
【问题讨论】:
-
你问怎么刮?或者您知道如何使用某个工具进行抓取,并且您需要帮助来抓取基于 disqus 的评论系统?如果是后者,则重新标记您的问题以包含工具的名称
-
嗨 Boaz.Jan,我在问如何刮。对于基于网页的新闻专线页面,例如guardian.co.uk/politics/2012/jan/10/…,我们只需要将commentpage 替换为2、3、4..,我们可以通过http get 来下载页面并抓取它。使用disqus,似乎没有办法用http get检索所有的cmets...
标签: web-scraping disqus