【问题标题】:Data scraping from pages从页面抓取数据
【发布时间】:2018-09-13 15:21:08
【问题描述】:
`webpage <- "https://www.naatp.org/resources/addiction-industry-directory"
for(i in 2:22) {

   data <- read_html(webpage) %>%
    html_nodes("table") %>%
    .[[1]] %>% 
    html_table()
  webpage <- html_session(webpage) %>% follow_link(css = ".pager-next a") %>% .[["url"]]
  data2<-rbind(data2,data )
}`

我为来自该站点的数据编写了数据抓取代码。即该站点有 22 个页面,我想将包含的数据抓取到诸如联系信息之类的页面中,例如 https://www.naatp.org/resources/addiction-industry-directory/3832/1-method-center 那么有人可以帮我解决这个问题吗?

【问题讨论】:

    标签: r web-scraping rvest


    【解决方案1】:

    这感觉像是一个duplicate 的问题,但你很接近,所以这里...

    library(tidyverse)
    library(rvest)
    
    pages <- 0:21
    urls <- paste0("https://www.naatp.org/resources/addiction-industry-directory?page=", pages)
    
    get_table <- function(url) {
      url %>%
        read_html() %>%
        html_table()
    }
    
    results <- sapply(urls, get_table)
    
    bind_rows(results) %>% 
      as_data_frame()
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2011-03-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-07-12
      • 1970-01-01
      • 2020-07-20
      相关资源
      最近更新 更多