【问题标题】:Spark creating huge amount of task when read from parquet files从镶木地板文件读取时,Spark 会创建大量任务
【发布时间】:2022-12-01 18:07:12
【问题描述】:

我在从小的分区镶木地板数据读取的 spark 查询上有一个非常高的任务数。

我正在尝试查询以 parquet snappy 文件格式存储在 S3 存储桶中的表。该表按日期/小时分区(一个分区示例:'2021/01/01 10:00:00')。每个分区文件大小在 30 到 70 kB 之间。

使用近 20.000 个任务计算 1 年数据的分区简单计数。我担心的是为什么 spark 会创建如此多的任务(多于分区)来读取如此少量的数据。 spark.sql.("select count(1), date_hour from forecast.hourly_data where date_hour between '2021_01_01-00' and '2022_01_01-00' group by date_hour")

[Stage 0:> (214 + 20) / 19123]

我的spark版本是2.4.7,配置是默认模式。

【问题讨论】:

    标签: apache-spark pyspark parquet


    【解决方案1】:

    任务量是根据你读入的文件量来决定的,读入数据后可以重新分区。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-08-15
      • 2017-01-22
      • 2019-01-09
      • 1970-01-01
      • 1970-01-01
      • 2021-08-27
      • 2019-08-04
      • 2022-06-16
      相关资源
      最近更新 更多