【问题标题】:Scrape HTML table with R用 R 抓取 HTML 表格
【发布时间】:2020-09-28 18:21:15
【问题描述】:

我正在尝试使用 rvest 包从该 URL 中删除 11 列表:https://www.iexindia.com/marketdata/rtm_market_snapshot.aspx

到目前为止,我一直在尝试使用此代码:

mrkt_snpshot <- read_html("https://www.iexindia.com/marketdata/rtm_market_snapshot.aspx")

my_data <- mrkt_snpshot %>%
  html_nodes("table") %>%
  html_table(fill=T)

这会将 URL 上的 27 个 HTML 表格作为数据框返回列表,其中一些具有多达 831 个变量。我也用过这个:

my_data <- mrkt_snpshot %>%
  html_node("table.Ab7d468cb4fc14dedb1fcfeae435d33ac132") %>%
  html_table()

但这只是返回一个空列表。

我需要帮助来为每个可用数据的日期提取包含 11 列的表。如果可能的话,我还需要自动执行此操作以在每天结束时提取数据。

谢谢!

【问题讨论】:

    标签: r web-scraping rvest


    【解决方案1】:

    这将为您提供您正在寻找的表格:

    library(rvest)
    mrkt_snpshot %>%
      html_nodes("table") %>%
      html_table(fill=T) %>% 
      .[[24]]
    

    【讨论】:

    • 谢谢多米尼克!另一个问题是从 URL 获取前几天的数据。使用这段代码我只能获取今天的数据,还需要抓取前几天的数据,所有这些数据都有相同的 URL。有什么建议吗?
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-06-07
    • 1970-01-01
    • 2015-12-14
    • 2020-10-19
    • 1970-01-01
    • 1970-01-01
    • 2016-01-31
    相关资源
    最近更新 更多