【发布时间】:2020-10-01 00:07:15
【问题描述】:
我正在使用 pyspark 中的以下代码执行聚合数组集合:
df1=df.groupBy('key').agg(collect_list('value'))
我知道诸如收集强制数据到单个节点之类的功能。是否有可能在利用分布式云计算的力量的同时实现相同的结果?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql collect
我正在使用 pyspark 中的以下代码执行聚合数组集合:
df1=df.groupBy('key').agg(collect_list('value'))
我知道诸如收集强制数据到单个节点之类的功能。是否有可能在利用分布式云计算的力量的同时实现相同的结果?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql collect
这里好像有点误会
collect 强制通过驱动程序收集数据,而不是分发
而
collect_list和collect_set默认是分布式操作。
【讨论】: