【问题标题】:distributing collect_list function across worker nodes跨工作节点分发 collect_list 函数
【发布时间】:2020-10-01 00:07:15
【问题描述】:

我正在使用 pyspark 中的以下代码执行聚合数组集合:

df1=df.groupBy('key').agg(collect_list('value'))

我知道诸如收集强制数据到单个节点之类的功能。是否有可能在利用分布式云计算的力量的同时实现相同的结果?

【问题讨论】:

    标签: apache-spark pyspark apache-spark-sql collect


    【解决方案1】:

    这里好像有点误会

    collect 强制通过驱动程序收集数据,而不是分发

    而

    collect_list和collect_set默认是分布式操作。

    【讨论】:

    • 但是当我执行它时,我看到负载仅在 Gangila 的一个节点中增加
    猜你喜欢
    • 2023-01-31
    • 2023-02-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-06-15
    • 2020-04-24
    • 1970-01-01
    相关资源
    最近更新 更多