【发布时间】:2016-06-23 18:23:57
【问题描述】:
我正在尝试从 www.speedtest.net/awards/ca/ontario 抓取数据,当我沿着某些路径前进时,标准功能似乎可以工作,但其他路径却没有。我不知道为什么。
例如,如果我进入标题并查找脚本它可以工作
library(rvest)
URL<-read_html("http://www.speedtest.net/awards/ca/ontario")
test1<-html_nodes(URL,xpath='/html/head/script[1]')
test1
这将按预期返回 {xml_nodeset (1)}。
但是如果我进入身体并尝试类似的东西
test2<-html_nodes(URL,xpath='/html/body/script[1]')
test2
我得到 {xml_nodeset (0)}。
为什么我无法访问 body 下的节点?
我正在尝试使用下面的代码,但我已将问题追溯到上述问题。
real<-html_nodes(URL,xpath='/html/body/div[1]/div[3]/div/div[2]/div/div[3]/div[2]/table')
real
有什么想法吗?
【问题讨论】:
-
您希望在
body下找到script标签吗? -
是的。我还尝试找到也应该存在的 div 标签并返回相同的 {xml_nodeset (0)}。
标签: r xpath web-scraping rvest