【发布时间】:2017-09-06 06:51:26
【问题描述】:
我有一个看起来像
的数据框scala> val df = sc.parallelize(Seq(("User 1","X"), ("User 2", "Y"), ("User 3", "X"), ("User 2", "E"), ("User 3", "E"))).toDF("user", "event")
scala> df.show
+------+-----+
| user|event|
+------+-----+
|User 1| X|
|User 2| Y|
|User 3| X|
|User 2| E|
|User 3| E|
+------+-----+
我想找到所有有事件“X”但没有事件“E”的用户
在这种情况下,只有“用户 1”符合条件,因为它没有事件“E”条目。我如何使用 Spark API 来做到这一点?
【问题讨论】:
-
创建 X 和 E 的 2 个 df 并使用不等于条件加入它们
标签: scala apache-spark apache-spark-sql