【发布时间】:2021-02-19 14:24:45
【问题描述】:
也许这个主题在其他帖子中得到了处理,但我找不到我的问题的解决方案。 我正在尝试从https://tradingeconomics.com/indicators 网站上抓取数据。我正在尝试抓取有关指标的数据,特别是国家名称和任何国家链接中包含的地块。
tradec = function(tradelink) {
trade_page = read_html(tradelink)
trade_element = trade_page %>% html_nodes(".primary_photo+ td a") %>%
html_text() %>% paste(collapse = ",")
return(trade_element)
}
main_page <- read_html("https://tradingeconomics.com/country-list/gdp-growth-rate")
country_list <- main_page %>%
html_nodes("#ctl00_ContentPlaceHolder1_ctl01_UpdatePanel1 a") %>%
html_text() %>%
trimws %>%
gsub(" ", "-", .)
tradec_df = data.frame()
for (i in country_list) {
link = paste0("https://tradingeconomics.com/", i , "/gdp-growth")
page = read_html(link)
country = page %>% html_nodes("#SelectCountries") %>% html_text()
tradec_charts = page %>% html_nodes("#ImageChart") %>% html_text
tradec_df = rbind(tradec_df, data.frame(country, tradec_charts, stringsAsFactors = FALSE))
print(paste("Page:", country_list))
}
在理想的世界中,我希望为每个国家打印一个页面,包括国家名称和情节。我很确定地块可能会以某种方式被刮掉并显示,尽管我不知道如何。 有什么建议吗?
【问题讨论】:
标签: r web-scraping gplots