【发布时间】:2018-01-15 08:16:30
【问题描述】:
我想知道Spark在摄取数据的时候,数据是在driver中摄取并发送给worker,Spark的指示节点从文件系统中读取数据吗?
我知道,在 Spark 流中,使用 Kafka 源,工作节点显然是从 Kafka 读取的。但是,当从文件系统读取时,我不确定它实际上是如何工作的。
案例一
A - 从文件系统读取时假设 文件系统是HDFS
A.1 - 驱动程序是否读取文件并将数据传输给工作人员 在旅途中还是让工人阅读文件
A.2 - 原始分区是否由 HDFS 的分区决定?
案例 2
B - 当来自本地文件系统或 S3 的文件系统时
B.1 - 分区会发生什么变化,无论我们从 HDFS 读取还是从本地文件系统读取,算法是否会发生变化? (在后一种情况下,将使用一种特殊的算法来代替依赖 HDFS 分区? B.2 - 工作人员是否参与读取数据,即使数据尚未分区?
我该如何澄清这一点?
【问题讨论】:
标签: apache-spark amazon-s3 hdfs