【发布时间】:2017-04-24 00:43:42
【问题描述】:
如果我们有一个未压缩的 320 块 HDFS 文件存储在 16 个数据节点的集群上。每个节点有 20 个块,如果我们使用 Spark 将此文件读入 RDD(在创建 RDD 时不显式传递 numPartitions)
textFile = sc.textFile("hdfs://input/war-and-peace.txt")
如果我们在每个节点上有 16 个执行器,那么 Spark RDD 将为每个执行器创建多少个分区?它会为每个 HDFS 块创建一个分区,即 20 个分区吗?
【问题讨论】:
标签: apache-spark hdfs