【问题标题】:How to specify cluster init script for spark Job如何为 Spark Job 指定集群初始化脚本
【发布时间】:2019-09-17 21:12:25
【问题描述】:

我的作业需要在集群上执行一些初始化脚本,目前我在作业创建中使用“现有交互式集群”选项并为集群指定了初始化脚本。但这会被视为更高的“数据分析工作量”。

是否有一个选项可以让我在作业创建页面中指定“新建自动集群”选项,并且仍然可以为新集群执行初始化脚本。我不确定是否推荐使用Global Init script,因为并非所有作业都需要那些初始化脚本,只有特定类别的作业需要初始化脚本。

【问题讨论】:

    标签: spark-structured-streaming azure-databricks


    【解决方案1】:

    要微调 Spark 作业,您可以在集群配置中提供自定义 Spark 配置属性。

    要为所有集群设置 Spark 属性,请创建一个全局初始化脚本:

    %scala
    dbutils.fs.put("dbfs:/databricks/init/set_spark_params.sh","""
      |#!/bin/bash
      |
      |cat << 'EOF' > /databricks/driver/conf/00-custom-spark-driver-defaults.conf
      |[driver] {
      |  "spark.sql.sources.partitionOverwriteMode" = "DYNAMIC"
      |}
      |EOF
      """.stripMargin, true)
    

    参考:“Spark Configuration”。

    希望这会有所帮助。


    如果这回答了您的问题,请点击“标记为答案”和“投票”。如果您有任何进一步的疑问,请告诉我们。

    【讨论】:

    • 我想我什至可以使用作业创建页面中的“新集群选项”并为集群配置指定初始化脚本。
    猜你喜欢
    • 2021-04-27
    • 1970-01-01
    • 1970-01-01
    • 2016-05-27
    • 2020-07-19
    • 2020-02-02
    • 1970-01-01
    • 1970-01-01
    • 2018-01-01
    相关资源
    最近更新 更多