【发布时间】:2019-06-07 05:10:59
【问题描述】:
对此有很多问题,但看不到我正在寻找的答案。
希望提取特定文本,使用我的代码可以使用的 .quoteText 类,但也提取 .quoteText 中的所有子节点:
url <- "https://www.goodreads.com/quotes/search?page=1&q=simone+de+beauvoir&utf8=%E2%9C%93"
quote_text <- function(html){
path <- read_html(html)
path %>%
html_nodes(".quoteText") %>%
html_text(trim = TRUE) %>%
str_trim(side = "both") %>%
unlist()
}
quote_text(url)
结果包含文本,还包含每个子节点!
这就是检查器工具带来的。我正在寻找的是突出显示的行,而不是同一代码下的子行。
一定有办法只刮掉那条线,不是吗?还是我需要收集该行,然后用str_extract / regex 删除其余行?
【问题讨论】: