【发布时间】:2020-06-07 16:23:08
【问题描述】:
我是 spark 的新手,对迭代器的 spark 内存使用有疑问。
当使用 Datasets 的 Foreach() 或 MapPartitions() 时(甚至直接调用 RDD 的 iterator() 函数),spark 是否需要先将整个分区加载到 RAM(假设分区在磁盘中)还是可以数据在我们继续迭代的过程中进行惰性加载(意味着 spark 只能加载部分分区数据执行任务并将中间结果保存到磁盘)
【问题讨论】:
标签: apache-spark