【发布时间】:2021-08-14 20:41:18
【问题描述】:
我刚刚开始进行需要使用 Azure Databricks 分析大量数据的数据分析。在计划使用 Databricks 笔记本进行分析时,我遇到了不同的存储选项来加载数据 a) DBFS - Databricks 的默认文件系统 b) Azure Data Lake (ADLS ) 和 c) Azure Blob 存储。看起来项目 (b) 和 (c) 可以安装到工作区中以检索数据以供我们分析。
了解了以上内容,请问以下问题可以澄清吗?
- 在 Databricks 上下文中使用这些存储选项时,它们之间有什么区别? DBFS 和 ADLS 是否包含 HDFS 的文件管理原则,例如将文件分成块、名称节点、数据节点等?
- 如果我装载 Azure Blob 存储容器来分析数据,我是否仍能获得与其他存储选项相同的性能?鉴于 Blob 存储是基于对象的存储,它是否仍将文件分成块并将这些块作为 RDD 分区加载到 Spark 执行器节点中?
【问题讨论】:
标签: azure databricks azure-databricks