【发布时间】:2022-12-01 18:07:12
【问题描述】:
我在从小的分区镶木地板数据读取的 spark 查询上有一个非常高的任务数。
我正在尝试查询以 parquet snappy 文件格式存储在 S3 存储桶中的表。该表按日期/小时分区(一个分区示例:'2021/01/01 10:00:00')。每个分区文件大小在 30 到 70 kB 之间。
使用近 20.000 个任务计算 1 年数据的分区简单计数。我担心的是为什么 spark 会创建如此多的任务(多于分区)来读取如此少量的数据。
spark.sql.("select count(1), date_hour from forecast.hourly_data where date_hour between '2021_01_01-00' and '2022_01_01-00' group by date_hour")
[Stage 0:> (214 + 20) / 19123]
我的spark版本是2.4.7,配置是默认模式。
【问题讨论】:
标签: apache-spark pyspark parquet