【问题标题】:How to use custom parquet compression algorithm?如何使用自定义拼花压缩算法?
【发布时间】:2018-01-06 11:02:55
【问题描述】:

是否可以在 Spark 中使用自定义压缩算法来读取和写入 Parquet 文件?

理想情况下,配置如下:

sqlContext.setConf("spark.sql.parquet.compression.codec", "myalgo")

【问题讨论】:

    标签: apache-spark apache-spark-sql parquet


    【解决方案1】:

    不,正如in the documentation(此处指的是版本 2.2.0)所述,唯一可接受的值是

    • uncompressed,
    • snappy,
    • gzip
    • lzo

    snappy 是默认值。

    这是由于 Parquet 本身的限制,它仅使用一组受限的压缩算法,如 this enumeration 中所列(适用于版本 1.5.0)。

    【讨论】:

    • 还有较新的 Parquet 版本支持 Brotli 和 ZStandard 作为压缩算法。但是这些可以被较新的 Parquet 阅读器阅读(我认为任何典型的 Hadoop 发行版都不支持这一点)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-09-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多