【发布时间】:2019-07-26 08:41:37
【问题描述】:
我正在尝试从新闻网站收集标题/标题和其他元素。但是,我使用的标签(我使用小工具选择器和检查网站代码发现的)似乎不起作用。
对于标题,我尝试了标签“.article-h”和“.article-h-link”,但没有结果。日期('.date.right')和潜在客户('.result-intro')也是如此
url_test <- read_html('https://www.semana.com/Buscador?query=proceso%20paz%20farc&post=semana&limit=10&offset=0&from=2012%2F08%2F26&to=2016%2F12%2F03')
titles <- html_text(html_nodes(url_test, '.article-h-link'))
我总是得到“字符 (0)”。不过,有趣的是,如果尝试在主页 (www.semana.com) 中收集信息,这些相同的标签可以毫无问题地工作。可能是什么问题?
【问题讨论】:
-
内容是通过在浏览器中运行的 javascript 动态加载的。 rvest 不会发生这种情况。您可能需要浏览器自动化,例如 RSelenium。
标签: r web-scraping rvest