【发布时间】:2016-10-21 03:05:06
【问题描述】:
我检查了之前的类似问题 - 没有运气......似乎可以让 readHTMLTable 阅读 Edgar 网页。我正在尝试阅读此网址:
...并将“文档”按钮下的所有 href 链接放入字符向量中。
“文档”链接位于表格中 - 来自 Firefox 检查工具的第一个“文档”href 链接如下所示:
<div id="seriesDiv" style="margin-top: 0px;">
<table class="tableFile2" summary="Results">
<tbody>
<tr></tr>
<tr>
<td nowrap="nowrap"></td>
<td nowrap="nowrap">
<a id="documentsbutton" href="/Archives/edgar/data/320193/000119312516559625/0001193125-16-559625-index.htm">
Documents
所以我想把href链接变成一个字符向量,以备后用。
问题 - XML 库给我带来了麻烦,htmltab 库函数似乎由于某种原因在我的 R 实例中没有得到识别。
这是我的代码:
library(XML)
EDGARURL <- "https://www.sec.gov/cgi-bin/browse-edgar?action=getcompany&CIK=AAPL&type=10-Q&dateb=&owner=exclude&count=100"
EDGARHREFtables <- readHTMLTable(EDGARURL, as.data.frame = TRUE)
这会导致以下错误:
Warning message: XML content does not seem to be XML: 'https://www.sec.gov/cgi-bin/browse-edgar?action=getcompany&CIK=AAPL&type=10-Q&dateb=&owner=exclude&count=100'
我错过了什么? XML 图书馆的 readHTMLTable 会在这方面工作吗?如果是这样,您如何提取每个文档的 href 标记?
【问题讨论】:
-
edgarpackage有什么不足吗?
标签: r web-scraping html-parsing href extract