【发布时间】:2018-01-06 11:02:55
【问题描述】:
是否可以在 Spark 中使用自定义压缩算法来读取和写入 Parquet 文件?
理想情况下,配置如下:
sqlContext.setConf("spark.sql.parquet.compression.codec", "myalgo")
【问题讨论】:
标签: apache-spark apache-spark-sql parquet
是否可以在 Spark 中使用自定义压缩算法来读取和写入 Parquet 文件?
理想情况下,配置如下:
sqlContext.setConf("spark.sql.parquet.compression.codec", "myalgo")
【问题讨论】:
标签: apache-spark apache-spark-sql parquet
不,正如in the documentation(此处指的是版本 2.2.0)所述,唯一可接受的值是
uncompressed, snappy, gzip 和lzosnappy 是默认值。
这是由于 Parquet 本身的限制,它仅使用一组受限的压缩算法,如 this enumeration 中所列(适用于版本 1.5.0)。
【讨论】: