【发布时间】:2023-02-26 03:48:14
【问题描述】:
我了解到数据帧加载阶段的 spark 分区大小由以下值决定:
- 总输入数据大小和文件数
- 文件格式属性(PARQUET 与 CSV、可拆分、...)
- spark.sql.files.maxPartitionBytes
- spark.default.parallelism
- spark.sql.files.openCostInBytes
假设分区大小确定为 128MB,如果输入文件是压缩的、可拆分的并且大于 128MB,那么分区是否包含高达 128MB 的压缩数据,或者是解压后的数据?我以为是前者,但我想仔细检查一下。
【问题讨论】:
标签: apache-spark pyspark