【问题标题】:Impala Hive and Spark Parquet File format SizeImpala Hive 和 Spark Parquet 文件格式大小
【发布时间】:2021-04-19 03:10:15
【问题描述】:

我对 impala、hive 和 spark 之间的镶木地板压缩毫无疑问 情况是这样的

  1. 表是 Hive,使用 Impala 插入数据,表大小如下,表文件扩展名为“data.0.parq” 59.0 M 177.1 M /user/hive/warehouse/database.db/tablename(parquet + 在 impala 中创建)
  2. 在 Hive tablename_snappy 中使用 snappy 压缩创建的同一张表设置为 TBLPROPERTIES ("parquet.compression"="SNAPPY") 使用 Tablename(步骤 1)将数据插入 Hive。 2a)为什么桌子尺寸更大? 2b)文件名是 000000_0 (这是预期的) 64.6 M 193.7 M /user/hive/warehouse/database.db/tablename_parq(parquet + snappy 压缩 + 在 Hive 中创建)
  3. 在 spark 中,我从步骤 1 中读取了表名,saveAsTable 和文件大小是否按预期减小,文件名是 ****.snappy.parquet 39.0 M 117.1 M /user/hive/warehouse/atabase.db/tablename_spark(parquet + snappy 压缩 + 在 Spark 中创建)
  4. 在 Impala 中创建的同一张表存储为 Parquet 并设置 COMPRESSION_CODEC=snappy; 没有变化,我预计表格大小应该会减少,因为我应用了快速压缩。 59.0 M 177.1 M /user/hive/warehouse/database.db/tablename(parquet + 在 impala 中创建)

请帮助我了解拼花压缩在 Impla 和 Hive 中的工作原理。

【问题讨论】:

    标签: apache-spark hive apache-spark-sql impala


    【解决方案1】:

    数据大小因创建 parquet 文件时选择的默认压缩编解码器而异。

    它不是特定于应用程序的。

    在 hive 表中插入数据之前尝试一下

     set COMPRESSION_CODEC =GZip
    

    你会发现文件压缩得更好。

    注意默认压缩是“snappy”

    link for format's

    【讨论】:

      猜你喜欢
      • 2019-11-10
      • 2019-10-28
      • 2022-01-07
      • 1970-01-01
      • 2023-04-03
      • 2017-09-16
      • 1970-01-01
      • 1970-01-01
      • 2019-01-20
      相关资源
      最近更新 更多