【发布时间】:2019-12-24 03:31:55
【问题描述】:
我正在尝试从这个 url 中抓取第一个表:
使用以下代码:
url <- "https://www.whoscored.com/Matches/318578/LiveStatistics/England-Premier-League-2009-2010-Blackburn-Arsenal"
data <- url %>%
read_html() %>%
html_nodes(xpath='//*[@id="top-player-stats-summary-grid"]')
给数据赋值{xml_nodeset (0)}
url <- "https://www.whoscored.com/Matches/318578/LiveStatistics/England-Premier-League-2009-2010-Blackburn-Arsenal"
data <- url %>%
read_html() %>%
html_nodes(css='.grid')
同样的问题。
显然这可能是一个 javascript 问题 - 有没有一种快速的方法来提取相关数据?检查表格条目似乎表明数据不是从其他地方导入的,而是编码到页面中的,所以似乎我应该能够从源代码中提取它(对不起,我完全不知道 HTML 和 JS 是如何工作的我的问题可能没有意义)。
【问题讨论】:
标签: r web-scraping rvest