【问题标题】:Web scraping using R - Table of many pages使用 R 进行网页抓取 - 多页表格
【发布时间】:2018-10-15 19:24:15
【问题描述】:

我有一个包含许多页面的网站。有人可以帮我将该表的所有页面读入 R 吗?

网站: https://www.fdic.gov/bank/individual/failed/banklist.html

【问题讨论】:

  • 请编辑您的问题以包含您迄今为止尝试过的代码。
  • 欢迎来到 SO。请阅读How to create a Minimal, Complete, and Verifiable Example 并更新您的帖子。如果您包含一个完整的示例,说明您正在尝试做什么以及您的代码失败的地方,您将更快地获得帮助。

标签: html r json xml web-scraping


【解决方案1】:

您可以使用 rvest 包抓取整个 HTML 表格。请参阅下面的代码。该代码自动识别整个表并读入所有 555 个条目。

require(rvest)

URL <- "https://www.fdic.gov/bank/individual/failed/banklist.html"

failed_banks <- URL %>%
  read_html() %>%
  html_table() %>%
  as.data.frame()

【讨论】:

  • 如何获取所有数据?它似乎没有做任何循环?您是否找到包含所有数据的主表?当我转到那个 URL 并按 F12 并搜索“表”时,我看到了 16 个表。 #13 似乎是主表,但同样,这似乎是此页面上唯一的表。如果不循环浏览所有 23 页,我不知道这是如何提取所有数据的。这是如何运作的?你能解释一下代码吗?谢谢。
猜你喜欢
  • 2014-12-28
  • 1970-01-01
  • 2018-02-15
  • 1970-01-01
  • 2015-09-06
相关资源
最近更新 更多