【发布时间】:2020-06-24 01:16:24
【问题描述】:
我有一个接收Dataset[(Row, Row)] 的函数,我正在尝试测试这个函数,但我不确定如何创建一个Dataset[(Row, Row)] 的数据集
我尝试了以下方法,但它说这是tuple2[DataFrame, DataFrame] 类型
val df: Dataset[(Row,Row)] = (
Seq(
("NOW", "active", 1, 11),
("BEFORE", "active", 2, 11),
("AFTER", "active", 3, 33)
).toDF(),
Seq(
("NOW", "sub_uuid1", 1, "com_uuid1"),
("BEFORE", "sub_uuid2", 2, "com_uuid2"),
(null, null, 3, null)
).toDF()
)
我怎样才能把上面的代码写成Dataset[(Row,Row)]
【问题讨论】:
-
这个函数有什么作用?你可以分享它的源代码吗?在我看来,使用
Row这样的结构来表示数据集中的一整行似乎很奇怪。 -
@jrook 这一点也不奇怪。
Row代表一个StructType,可以是结构列或行。
标签: scala apache-spark apache-spark-sql apache-spark-dataset