【发布时间】:2017-07-02 17:48:27
【问题描述】:
我正在尝试出于私人目的(非商业用途)抓取 transfermarkt 数据。
特别是,我需要有关给定时间段内所有转移的信息。可以按天搜索转帐,我的计划是使用此页面搜索每天:https://www.transfermarkt.co.uk/transfers/transfertagedetail/statistik/top/plus/0?land_id_ab=&land_id_zu=&leihe=&datum=2000-07-02
我需要这个页面底部的表格。
我正在使用rvest 来做这件事。代码如下:
library(dplyr)
library(rvest)
url = "http://www.transfermarkt.co.uk/transfers/transfertagedetail/statistik/top/plus/0?land_id_ab=&land_id_zu=&leihe=&datum=2000-07-02"
site = read_html(url)
site %>% html_node("#yw1 td") %>% html_table() %>% View()
我收到一个错误:
open.connection(x, "rb") 中的错误:HTTP 错误 404。
此代码大约一年前有效,但现在不行。我尝试添加html_session,但结果是一样的。
你能帮帮我吗?
【问题讨论】:
标签: r web-scraping rvest