【发布时间】:2020-09-17 03:07:55
【问题描述】:
使用包含列的数据框,列中的值是列表,
id | values
1 | ['good','good','good','bad','bad','good','good']
2 | ['bad','badd','good','bad',Null,'good','bad']
....
如何获得列表中显示频率最高的字符串? 预期输出:
id | most_frequent
1 | 'good'
2 | 'bad'
....
【问题讨论】:
-
你试过this 吗?
-
这是针对整个列的,我需要为值列中的每个列表找到最大值。
-
是的,同样的 udf 也可以用于单列数组。但是,对于 spark 2.4+ ,接受的答案更好。
标签: apache-spark pyspark