【发布时间】:2021-04-19 03:10:15
【问题描述】:
我对 impala、hive 和 spark 之间的镶木地板压缩毫无疑问 情况是这样的
- 表是 Hive,使用 Impala 插入数据,表大小如下,表文件扩展名为“data.0.parq” 59.0 M 177.1 M /user/hive/warehouse/database.db/tablename(parquet + 在 impala 中创建)
- 在 Hive tablename_snappy 中使用 snappy 压缩创建的同一张表设置为 TBLPROPERTIES ("parquet.compression"="SNAPPY") 使用 Tablename(步骤 1)将数据插入 Hive。 2a)为什么桌子尺寸更大? 2b)文件名是 000000_0 (这是预期的) 64.6 M 193.7 M /user/hive/warehouse/database.db/tablename_parq(parquet + snappy 压缩 + 在 Hive 中创建)
- 在 spark 中,我从步骤 1 中读取了表名,saveAsTable 和文件大小是否按预期减小,文件名是 ****.snappy.parquet 39.0 M 117.1 M /user/hive/warehouse/atabase.db/tablename_spark(parquet + snappy 压缩 + 在 Spark 中创建)
- 在 Impala 中创建的同一张表存储为 Parquet 并设置 COMPRESSION_CODEC=snappy; 没有变化,我预计表格大小应该会减少,因为我应用了快速压缩。 59.0 M 177.1 M /user/hive/warehouse/database.db/tablename(parquet + 在 impala 中创建)
请帮助我了解拼花压缩在 Impla 和 Hive 中的工作原理。
【问题讨论】:
标签: apache-spark hive apache-spark-sql impala