【发布时间】:2021-03-31 01:53:00
【问题描述】:
我在尝试从新闻网站抓取所有链接网址时遇到问题。
https://www.lightreading.com/archives.asp?section_id=120&piddl_month=12&piddl_year=2020
这是站点链接,我正在尝试抓取文章标题上的所有超链接 URL。 下面是我想出的代码 - 认为 '.card-title' 是一个类,而 'href' 是一个属性,
library(httr)
library(rvest)
library(readr)
url <- paste('https://www.lightreading.com/archives.asp?section_id=120&piddl_month=12&piddl_year=2020')
data_url <- read_html(url) %>%
html_nodes('.card-title') %>%
html_attr("href") %>%
html_text()
UseMethod("xml_text") 中的错误: 没有适用于“字符”类对象的“xml_text”方法
这是我收到的错误消息。我做错了什么?
【问题讨论】:
标签: r web-crawler rvest