【发布时间】:2018-06-13 09:47:46
【问题描述】:
我有 JavaPairRDD 格式的数据
JavaPairdRDD<Tuple2<String, Tuple2<String,String>>>
我尝试使用下面的代码
Encoder<Tuple2<String, Tuple2<String,String>>> encoder2 =
Encoders.tuple(Encoders.STRING(), Encoders.tuple(Encoders.STRING(),Encoders.STRING()));
Dataset<Row> userViolationsDetails = spark.createDataset(JavaPairRDD.toRDD(MY_RDD),encoder2).toDF("value1","value2");
但是如何生成具有 3 列的数据集???由于上述代码的输出为我提供了 2 列中的数据。任何指针/建议???
【问题讨论】:
-
你想要什么扁平化元组?试试
toDF("value1","value2","value3") -
@jojo_Berlini 尝试这样做,但它给出了错误。
-
这似乎是一个错误 - 元组中的值应该具有区分字段名称。随意创建 Jira 票
-
感谢 @T.Gawęda 的回复,我已经创建了 Jira 票 issues.apache.org/jira/browse/SPARK-24548 让我们看看何时有人拿起它
标签: java apache-spark java-pair-rdd