【问题标题】:What is the best practice to load a delta table specific partition in databricks?在数据块中加载增量表特定分区的最佳实践是什么?
【发布时间】:2021-07-12 08:37:12
【问题描述】:

我想知道加载增量表特定分区的最佳方法是什么? 选项 2 是在过滤之前加载所有表吗?

选项 1:

df = spark.read.format("delta").option('basePath','/mnt/raw/mytable/')\
   .load('/mnt/raw/mytable/ingestdate=20210703')

(这里需要 basePath 选项吗?)

选项 2:

df = spark.read.format("delta").load('/mnt/raw/mytable/')
df = df.filter(col('ingestdate')=='20210703')

提前非常感谢!

【问题讨论】:

    标签: apache-spark pyspark partitioning azure-databricks delta-lake


    【解决方案1】:

    在第二个选项中,spark 仅加载已在过滤条件中提及的相关分区,内部 spark 执行partition pruning 并仅从源表加载相关数据。

    而在第一个选项中,您直接指示 spark 仅加载定义的各个分区。

    因此,在这两种情况下,您最终都只会加载各自的分区数据。

    【讨论】:

      猜你喜欢
      • 2015-01-13
      • 1970-01-01
      • 1970-01-01
      • 2011-04-17
      • 2023-03-03
      • 2014-11-10
      • 1970-01-01
      • 1970-01-01
      • 2017-12-11
      相关资源
      最近更新 更多