【发布时间】:2018-10-21 22:52:29
【问题描述】:
我正在尝试将 RDD[String] 转换为 Dataframe。该字符串以逗号分隔,因此我想为逗号之间的每个值获取一列。 为此,我尝试了以下步骤:
val allNewData_split = allNewData.map(e => e.split(",")) //RDD[Array[String]]
val df_newData = allNewData_split.toDF() //DataFrame
但我明白了:
+--------------------+
| value|
+--------------------+
|[0.0, 0.170716979...|
|[0.0, 0.272535901...|
|[0.0, 0.232002948...|
+--------------------+
这不是这篇文章 (How to convert rdd object to dataframe in spark) 的重复,因为我要求的是 RDD[String] 而不是 RDD[Row]。
它也不是 Spark - load CSV file as DataFrame? 的重复,因为这个问题不是关于将 CSV 文件作为 DataFrame 读取。
【问题讨论】:
-
Spark 的可能副本 - 将 CSV 文件加载为 DataFrame?](stackoverflow.com/q/29704333/9613318)
-
我在那个链接中寻找答案,@Yogesh,但他们使用 RDD[Row]。
标签: scala apache-spark