【发布时间】:2014-07-21 17:22:36
【问题描述】:
您好,我已经进行了深入的研究并达到了这个程度。我要做的就是提取跨越许多网页的 HTML 表格。
我必须查询网站 sec.gov 的数据库,然后该表返回适当数量的结果(每个查询的大小和页数都不同)。例如:
链接:http://www.sec.gov/cgi-bin/srch-edgar
要给出的输入:
输入搜索字符串框: form-type=(8-k) ANDfiling-date=20140523
开始: 2014
结束: 2014
如何在不打开浏览器的情况下在 R 中完全做到这一点?
我正在分享我所做的一切
我尝试了很多包,最接近的是包 RCurl。但是在 getURL 函数中,我打开了浏览器,在浏览器中运行查询并将其粘贴到 getURL 中。它返回了一个很长的字符,其中包含可以循环并产生我想要的输出的 URL。所有这些信息都在输出的“中心”标签中。
现在我不知道如何从字符中间取出这些 URL。
另外,这不是我想要的。我想直接从 R 运行 Web 查询,并将各种 HTML 表输出直接输入到 R。这可能吗?
谢谢 米娜
【问题讨论】:
标签: html r xml-parsing html-parsing