【发布时间】:2018-08-13 14:31:15
【问题描述】:
我是 PySpark 的新手,所以很抱歉,如果这有点简单,我发现了其他比较数据帧的问题,但不是这样的问题,因此我不认为它是重复的。 我正在尝试比较两个具有相似结构的日期框。 “名称”将是唯一的,但计数可能不同。
因此,如果计数不同,我希望它生成数据框或 python 字典。就像下面一样。关于我将如何实现这样的目标的任何想法?
DF1
+-------+---------+
|name | count_1 |
+-------+---------+
| Alice| 1500 |
| Bob| 1000 |
|Charlie| 150 |
| Dexter| 100 |
+-------+---------+
DF2
+-------+---------+
|name | count_2 |
+-------+---------+
| Alice| 1500 |
| Bob| 200 |
|Charlie| 150 |
| Dexter| 10 |
+-------+---------+
产生结果:
不匹配
+-------+-------------+--------------+
|name | df1_count | df2_count |
+-------+-------------+--------------+
| Bob| 1000 | 200 |
| Dexter| 100 | 10 |
+-------+-------------+--------------+
匹配
+-------+-------------+--------------+
|name | df1_count | df2_count |
+-------+-------------+--------------+
| Alice| 1500 | 1500 |
|Charlie| 150 | 150 |
+-------+-------------+--------------+
【问题讨论】:
-
看来你应该
join2 个数据帧和filter只包含 count_1 和 count_2 相等的行
标签: python dataframe apache-spark pyspark apache-spark-sql