【发布时间】:2020-07-15 15:48:12
【问题描述】:
我的问题类似于:
Standalone Spark cluster on Mesos accessing HDFS data in a different Hadoop cluster
虽然上面的问题是关于使用 spark 处理来自不同 hadoop 集群的数据,但我也想知道 spark 如何处理来自 azure blob 存储容器的数据。
来自 azure 文档 (https://docs.microsoft.com/en-us/azure/databricks/data/data-sources/azure/azure-storage),以下代码用于将数据直接加载到数据帧中:
val df = spark.read.parquet("wasbs://<container-name>@<storage-account-name>.blob.core.windows.net/<directory-name>")
当对数据帧应用 udf 等操作时,是否将完整的数据传输到驱动程序内存,然后在执行程序之间拆分?
位置是否在处理过程中发挥作用?例如,如果 spark 集群和数据(在 azure blob 存储容器或不同的 hadoop 集群上)位于不同的数据中心,如何处理?
【问题讨论】:
标签: azure apache-spark apache-spark-sql azure-databricks