【发布时间】:2019-09-20 12:47:30
【问题描述】:
请帮帮我。
我是 R 中网络抓取的新手。我想收集链接 在此页面下载数据表 (http://burkinafaso.opendataforafrica.org/)。我的项目是让这些数据更易于访问。
这里是网站:http://burkinafaso.opendataforafrica.org/
在页面 Donnée 我有一个部门列表。 农业:43桌 公共帮助:7张桌子 ...
当我点击农业时,我得到了数据集列表。 https://drive.google.com/open?id=1cInWz62HjbcpgJ00rK-8Q-0p71mC59hq
- 我想获取这些标题的列表。
- 为每个标题获取数据集的下载链接。
我在下面尝试了这段代码来查看网站的结构。 但我没有看到可以让我提取这些链接的架构。
library(RCurl)
library(XML)
library(rvest)
URL <- "http://burkinafaso.opendataforafrica.org/"
pg <- read_html(URL)
p <- html_children(pg)[1]
pp <- html_children(pg)[2]
html_structure(p)
html_structure(pp)
library(RCurl)
library(XML)
library(rvest)
URL <- "http://burkinafaso.opendataforafrica.org/data/#topic=Agriculture"
pg <- read_html(URL)
p <- html_children(pg)[1]
pp <- html_children(pg)[2]
html_structure(p)
html_structure(pp)
例如,我尝试将这段代码用于标签中的链接。 但我没有得到不同的下载链接。
URL <- "http://burkinafaso.opendataforafrica.org/data/#topic=Agriculture"
pg <- read_html(URL)
all.url <- html_attr(html_nodes(pg, "a"), "href")
all.url <- as.data.frame(all.url)
正如我所期望的那样,对于每个它 表格列表和下载链接。例如:
公共援助 (7):
标记链接
Aide extérieure par secteur de 1995 à 2006 (en Million de FCFA) 下载链接 Aide extérieure par type (en Million de FCFA) 下载链接
请帮帮我。
【问题讨论】:
标签: javascript html r web-scraping