【发布时间】:2021-07-12 08:37:12
【问题描述】:
我想知道加载增量表特定分区的最佳方法是什么? 选项 2 是在过滤之前加载所有表吗?
选项 1:
df = spark.read.format("delta").option('basePath','/mnt/raw/mytable/')\
.load('/mnt/raw/mytable/ingestdate=20210703')
(这里需要 basePath 选项吗?)
选项 2:
df = spark.read.format("delta").load('/mnt/raw/mytable/')
df = df.filter(col('ingestdate')=='20210703')
提前非常感谢!
【问题讨论】:
标签: apache-spark pyspark partitioning azure-databricks delta-lake