【发布时间】:2019-09-12 15:12:49
【问题描述】:
这是我的代码:
library(rvest)
library(XML)
library(xml2)
url_imb <- 'https://www.imdb.com/search/title/?count=100&release_date=2016,2016&title_type=feature'
web_page<-read_html(url_imb)
我想提取与adv_li_dr_0tags 相关的所有董事姓名。
这就是我所做的: CSS 选择器:
directors_0<-html_text(html_nodes(web_page,"p a"))
XPATH 选择器:
directors_0<-html_attr(html_nodes(web_page,xpath='//p[@class=""]//a'),"href")
当然是不完整的。但是你能帮帮我吗?如何提取与href中的标签相关的元素。
【问题讨论】:
-
这就是你所追求的吗?
web_page %>% html_nodes(".text-muted+ p a:nth-child(1)") %>% html_text()? -
@JasonAizkalns 是的。你能提供 XPATH 吗?
标签: r web-scraping