【发布时间】:2020-11-07 13:09:49
【问题描述】:
我目前在版本 2.4.5 上有一个由 1 个驱动程序和 2 个工作人员组成的 Spark 集群。
我想进一步优化并行性以在加载和处理数据时获得更好的吞吐量,当我这样做时,我经常在控制台上收到这些消息:
WARN scheduler.TaskSetManager: Stage contains a task of very large size (728 KB). The maximum recommended task size is 100 KB.
这是如何工作的?我对 Spark 技术相当陌生,但了解它的基础知识,我想知道如何优化它,但我不确定它是否涉及将 Slave 配置为拥有更多执行器,这样可以获得更多并行性,或者如果我需要使用合并或重新分区功能对我的数据框进行分区。
提前谢谢你们!
【问题讨论】:
标签: python apache-spark pyspark cluster-computing