【发布时间】:2017-01-04 22:10:23
【问题描述】:
谁能纠正我对 Spark 坚持的理解。
如果我们在一个 RDD 上执行了 cache() ,它的值只缓存在那些最初计算 RDD 的节点上。 意思是,如果有 100 个节点的集群,并且 RDD 是在第一个和第二个节点的分区中计算的。如果我们缓存了这个 RDD,那么 Spark 只会在第一个或第二个工作节点中缓存它的值。 所以当这个 Spark 应用程序在后期尝试使用这个 RDD 时,Spark 驱动程序必须从第一个/第二个节点获取值。
我说的对吗?
(或)
RDD 值是否持久保存在驱动程序内存中而不是节点上?
【问题讨论】:
标签: apache-spark apache-spark-sql rdd