【发布时间】:2018-08-27 05:23:19
【问题描述】:
我有 pyspark 数据框,我想用列 A 和 B 过滤数据框。现在我只想获取 B 的值,其中 A 的出现大于某个数字 N。
A 列就像和 id 一样,可以有重复的值。现在我正在分组,过滤和使用效率不高的值列表,所以我正在寻找有效的解决方案。
例子
N = 5
输入Image
预期输出Image
您可以在此处看到仅选择了 A 列的 ID1 和 ID3,因为阈值 5 其余所有都被排除在外。
【问题讨论】:
-
你能分享你的尝试吗?
-
你可能想看看这个问题stackoverflow.com/questions/45395093/…
标签: python apache-spark dataframe pyspark