【发布时间】:2016-06-23 19:34:26
【问题描述】:
我有一个 PySpark DataFrame,我将它分组在一个字段(列)上,目的是消除每个组的记录,这些记录具有另一个字段的特定值。 例如,表格看起来像
colA colB
'a' 1
'b' 1
'a' 0
'c' 0
这里我想要删除有重复 colA 和 colB 为 0 的记录,以便获得
colA colB
'a' 1
'b' 1
'c' 0
'c' 的行仍然存在,因为我只想删除重复(在 colA 上)行的 0。
我想不出一种方法来实现这一点,因为如果expr 不是“avg”、“max”之一,我不精通在groupBy 之后使用agg 的方法等。
【问题讨论】:
标签: python sql apache-spark aggregate pyspark