【发布时间】:2018-05-27 18:53:03
【问题描述】:
我正在尝试从网页中抓取数据,但是我收到以下 URL 的 404 错误。但是,我需要浏览器中的 404 链接中的数据。示例如下:
library(tidyverse)
library(rvest)
url <- "http://www.uscho.com/scoreboard/division-i-men/20172018/composite-schedule/"
link_list <- url %>%
read_html() %>%
html_nodes("td:nth-child(13) a") %>%
html_attr("href") %>%
{paste0("http://www.uscho.com", .)}
现在,例如,在您的网络浏览器中搜索此处的第 200 个示例 (http://www.uscho.com/recaplink.php?gid=1_970_20172018)。你会得到这个:
我实际上并不想要 404 错误,但在地址栏中,有一个 URL——经过一些操作——我可以用来获取我想要的实际网页 ("https://www.uscho.com/recaps/?p=171810970")
但是,此 URL 不会显示在 R 中。运行 read_html(link_list[200]),我只会收到 404 错误。
知道如何在 R 中从浏览器获取 URL 吗?
【问题讨论】:
-
如果您已经找到该模式。您可以使用搜索参数
?p=****将相同的模式应用于其他搜索 -
什么意思?老实说,我仍然不确定确切的模式是什么
-
哦,我以为你已经知道这种模式了。您是否尝试过测试您发现的模式?
-
是的,我已经尝试了一些方法,看看是否可以避免问这个问题,但似乎没有一个简单的模式
-
似乎某些链接已过期、更改或删除,并且未在该表上更新。您可以根据该网站的结构尽力猜测实际链接。但我认为没有更好的方法。
标签: r web-scraping rvest