【发布时间】:2015-10-19 09:36:35
【问题描述】:
我正在尝试使用 SparkR 将数据从本地 hdfs 加载到 R-Studio。
当我这样做时:
df_hadoop <- read.df(sqlContext, "hdfs://xxx.xx.xxx.xxx:xxxx/user/lam/lamr_2014_09.csv",
source = "com.databricks.spark.csv")
然后是这个:
str(df_hadoop)
我明白了:
Formal class 'DataFrame' [package "SparkR"] with 2 slots
..@ env: <environment: 0x000000000xxxxxxx>
..@ sdf:Class 'jobj' <environment: 0x000000000xxxxxx>
这不是我正在寻找的 df,因为我试图从 hdfs 加载的 csv 中有 13 个字段。
我有一个包含 csv 的 13 个字段的架构,但我在哪里或如何将它告诉 SparkR?
【问题讨论】:
-
其实还没解决。我已经设法用 Scala 获得了第一行,但没有设法让 str() 或 head() 在 SparkR 中运行。这可能是内存问题,因为有 6100 万。行。我还可以使用 PySpark 和 Scala 计算行数,但不能使用 SparkR 中的 nrow() ...