【问题标题】:R: parsing data into a table after webscrapingR:网页抓取后将数据解析成表格
【发布时间】:2018-04-20 05:17:23
【问题描述】:

我可以对一些数据进行网络抓取,但在将其格式化为包含四列、空列、三列的表格时遇到问题。

library("methods")
library(rvest)

page <- read_html("https://www.galmarley.com/prices/CSV/AUX/USD/600/Full")
page
sources <- page %>%html_text()
as.data.frame(sources)

感谢您的帮助。

【问题讨论】:

    标签: r web-scraping rvest


    【解决方案1】:

    所以source 对象最终是一个字符串,但幸运的是它的格式很好。在这种情况下,read.table 可以很好地将其放入单个数据帧中。然后您可以使用stringr::str_split_fixed 来拆分用于分隔列的逗号。

    library(stringr)
    df <- read.table(text = sources, sep = "\n")
    df <- str_split_fixed(df$V1, pattern = ",", 9)
    df <- as.data.frame(df)
    

    【讨论】:

    • 太好了。谢谢。
    【解决方案2】:

    您拥有的网站实际上不是一个页面,而是一个文档。只需在末尾添加.csv 并读取数据:

      read.csv("https://www.galmarley.com/prices/CSV/AUX/USD/600/Full.csv")
    

    或者你可以直接阅读你所拥有的:

     read.csv(text=sources)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-02-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多