【发布时间】:2021-02-16 09:42:27
【问题描述】:
我想知道在以下场景中如何将数据加载到 spark 中:
有 10 GB 的交易数据以 parquet 格式存储在 S3 中,我将运行一个 Spark 程序来对该 10 GB Parquet 文件中的每条记录进行分类(例如收入、购物、餐饮)。
我有以下问题:
- 如何将这 10 GB 分配给 Spark 集群中的不同工作程序?将 10 GB 文件加载到 Spark Master 然后 Master 中是否拆分数据并发送给执行程序?
- 如果所有这些都发生在内存中?如果其中一个 executor 在作业运行期间崩溃了,master 是否会再次从 S3 加载 10 GB 文件并提取应该由崩溃的 executor 处理的数据子集并发送给另一个 executor?
【问题讨论】: