【发布时间】:2017-07-31 14:37:36
【问题描述】:
我有一些这样的数据:
id country salary
1 US 2000
2 US 3500
3 US 2600
4 JPN 2500
5 JPN 3800
6 CHN 2400
7 CHN 3200
我想按“国家”分组,然后计算薪水的 75,95,99 分位数 我该怎么办? 有没有类似计算平均值的方法,类似于
df.groupBy("country").agg(sum($"salary"))
and
df.groupBy("country").agg(quantileFunction)
【问题讨论】:
标签: apache-spark spark-dataframe aggregate-functions