【发布时间】:2016-08-20 19:55:29
【问题描述】:
我已安装 R 3.3.1,并且正在使用 RStudio 0.99.903。我正在尝试从以下 URL 将表格读入 R:https://www.fantasypros.com/nfl/rankings/consensus-cheatsheets.php
(我很清楚有一个下载按钮,但是,我现在不能选择)
去年我可以使用 readHTMLTable 函数轻松地做到这一点。但是,在那个时候,该站点从使用 http 更改为 https,这会导致“XML 内容不是 XML”错误。
我尝试了这里的建议:get url table into a `data.frame` R-XML-RCurl
library(XML)
library(RCurl)
url <- getURL("https://www.fantasypros.com/nfl/rankings/consensus-cheatsheets.php")
df <- readHTMLTable(URL, header = T)
get URL 函数返回一个对我来说基本上没有意义的大字符串,这意味着 readHTMLTable 不能正常工作(我得到一个列表,有几个数据框,但这些对我来说也没有意义。它是西班牙语对我不知道它们来自哪里的事物进行观察):
>url
[1] "\r\n<!DOCTYPE html>\n<html lang=\"en\">\n\n<head>\n <title>2016 QB Fantasy Football Rankings, QB Cheat Sheets, QB Draft / Draft Rankings</title>\n <meta http-equiv=\"Content-Type\" content=\"text/html; charset=UTF-8\">\n <meta name=\"description\" content=\"Don’t trust any 1 fantasy football expert? We combine their rankings into 1 Expert Consensus Ranking. Our 2016 Draft QB rankings are updated daily.\">\n<link rel=\"canonical\" href=\"https://www.fantasypros.com/nfl/rankings/qb-cheatsheets.php\" />\n\n <meta property=\"fb:pages\" content=\"184352014941166\"/>\n
它还有很多方法。
有人可以给我一些关于如何让它工作的建议吗?
谢谢。
【问题讨论】:
-
这已经过去了将近一年,但是您的代码现在适用于我在 R 版本 3.4.0 Patched (2017-05-02 r72649) 下:Windows 10 x64 (build 14393) using RCurl 1.95-4.8 , bitops 1.0-6 和 XML 3.98-1.7 除了问题
URL的第4行代码应该是url与第三行保持一致。
标签: r