【发布时间】:2020-09-15 05:32:36
【问题描述】:
我所在的组织正在从他们旧的传统执行方式迁移到公共云。我们必须为在云上发生的所有处决付费。为了降低执行成本,我们正在做两件事:
- 我们正在努力避免所有错误的执行。
- 我们正在尝试进一步减少执行时间。
作为一名大数据工程师,我的工作主要依赖于 SparkSQL,我正在努力减少 SQL 查询的执行时间。催化剂在执行时做什么,我想在执行之前这样做。用于读取逻辑计划、优化逻辑计划和生成物理计划等。 我还想在催化剂中添加我的自定义优化计划,这也将在构建时触发。
在执行之前有什么办法可以做到这一切吗?
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql