【发布时间】:2018-11-08 18:27:53
【问题描述】:
我正在尝试了解 Dataset#persist 在 spark 中发生变异的状态。然而,我最初认为我应该将返回值用于下一个操作;看来这是对同一实例的引用,而状态实际上在同一 Dataset 内发生了变化。
这是否意味着 spark 实际上正在改变数据集的状态?也就是说,这是否意味着数据集不是纯粹的功能,因为它保持可变状态?或者,这是否与会话有关?如果是这样,再一次;从功能上讲,这意味着即使是通过代理,数据集仍然包含可变状态。
scala> var x = sc.parallelize(List(1, 2, 3)).toDS
x: org.apache.spark.sql.Dataset[Int] = [value: int]
scala> x.explain()
== Physical Plan ==
*(1) SerializeFromObject [input[0, int, false] AS value#25]
+- Scan ExternalRDDScan[obj#24]
scala> var y = x.persist();
y: org.apache.spark.sql.Dataset[Int] = [value: int]
scala> y.explain();
== Physical Plan ==
*(1) InMemoryTableScan [value#25]
+- InMemoryRelation [value#25], true, 10000, StorageLevel(disk, memory, deserialized, 1 replicas)
+- *(1) SerializeFromObject [input[0, int, false] AS value#25]
+- Scan ExternalRDDScan[obj#24]
scala> x.explain();
== Physical Plan ==
*(1) InMemoryTableScan [value#25]
+- InMemoryRelation [value#25], true, 10000, StorageLevel(disk, memory, deserialized, 1 replicas)
+- *(1) SerializeFromObject [input[0, int, false] AS value#25]
+- Scan ExternalRDDScan[obj#24]
scala> y.unpersist();
res6: org.apache.spark.sql.Dataset[Int] = [value: int]
scala> x.explain();
== Physical Plan ==
*(1) SerializeFromObject [input[0, int, false] AS value#25]
+- Scan ExternalRDDScan[obj#24]
scala> y.explain();
== Physical Plan ==
*(1) SerializeFromObject [input[0, int, false] AS value#25]
+- Scan ExternalRDDScan[obj#24]
【问题讨论】:
标签: apache-spark