【发布时间】:2021-08-04 01:39:08
【问题描述】:
我有一个表格 DF,如下所示
ID Days
1 30
2 55
3 32
4 12
5 100
.....
我想得到如下计数:
month count
30 days and greater 20,000
60 days and greater 15,323
90 days and greater 11,232
.....
3600 days and greater 55
我的代码非常简单明了,我只是为每个月应用过滤器,并获取计数,然后复制并粘贴到 Excel 中,如下所示:
month1 = df.filter("Days >= 30").agg(countDistinct('ID')).show()
month2 = df.filter("Days>= 60").agg(countDistinct('ID')).show()
month3 = df.filter("Days >= 90").agg(countDistinct('ID')).show() ....
确实效率不高。
我想知道是否有更简单的方法可以做到这一点?并像这样创建一个表。
感谢高级!
【问题讨论】:
标签: python sql apache-spark pyspark apache-spark-sql