【发布时间】:2022-01-14 22:32:55
【问题描述】:
使用Apache Spark,我们可以在保存为 Parquet 格式时将数据帧分割成单独的文件。
在the way Parquet files are written 中,每个分区包含多个行组,每个行组都包含与每个组相关的列统计信息(例如,最小/最大值,以及NULL 值的数量)。
现在,在某些情况下,组织 Parquet 文件以使相关数据一起出现在一个或多个行组中似乎是理想的。这将是每个分区文件(构成第一级)内的第二级分区。
这可以使用例如pyarrow,但我们如何使用分布式 SQL 引擎(如 Spark)来做到这一点?
【问题讨论】:
标签: apache-spark parquet