【发布时间】:2018-10-16 00:24:43
【问题描述】:
我想从 hockey-reference.com 抓取数据,特别是从这个链接:
https://www.hockey-reference.com/leagues/NHL_1991.html
我想要第 4 个表,称为“团队统计数据”,并且我还想减去第一行和最后一行(但这可以是另一次)。
最初,我希望抓取 1991 年的链接,但我希望最终抓取 1991 年到 2017 年的每个链接。
library(tidyverse)
library(rvest)
stat_urls <- "https://www.hockey-reference.com/leagues/NHL_1991.html"
为了简单起见,我现在只有 1991 年的链接。在使用实际网页的“检查”源进行了相当彻底的搜索之后,即使我尝试了多种不同的选择,我似乎也找不到正确的 css 选择。我尝试了以下 CSS 选择:
table#stats.sortable.stats_table.now.sortable
#stats
#all_stats
#all_stats > div.table_outer_container
#stats
#stats > tbody
#div_stats (and all sorts of combos with this one)
在以下代码中使用时,这些都不起作用:
team_stats <- stat_urls %>%
read_html() %>%
html_nodes("#stats") %>%
html_table(header = T)
所有使用“xpath=”的尝试也都失败了。对此的任何帮助都将是绝对惊人的,Go Preds!
【问题讨论】: