【发布时间】:2016-01-18 13:01:07
【问题描述】:
我的 Spark 应用程序分几个阶段处理输入 CSV 文件。在每个阶段,创建的 RDD 都很大(以 MB 到 GB 为单位)。我创建了不同数量的分区并尝试过,但分区总是不均匀地完成阶段。一些分区很快就完成了一个阶段,但最后几个分区总是花费大量时间并不断抛出 heartbeat timeout 和 executor lost failures 并不断重试。
我尝试将分区数更改为不同的值,但最后几个分区始终无法完成。我也尝试了很久也无法解决这个问题。
我该如何处理?
【问题讨论】:
-
您能否包含导致此问题的代码?您是在 YARN、Mesos 上运行还是在独立模式下运行?
-
@GlennieHellesSindholt 显示的输出在 YARN 上。独立也会导致内存问题,从而导致执行程序失败。代码在pastebin.com/D7VAVW8U
标签: scala apache-spark