【发布时间】:2013-01-27 01:05:03
【问题描述】:
我们意识到为 Hadoop 处理以 GZip 格式存档我们的文件并不是一个好主意,这有点太晚了。 GZip 是不可拆分的,作为参考,这里不再赘述:
- Very basic question about Hadoop and compressed input files
- Hadoop gzip compressed files
- Hadoop gzip input file using only one mapper
- Why can't hadoop split up a large text file and then compress the splits using gzip?
我的问题是:BZip2 是允许 Hadoop 并行处理单个存档文件的最佳存档压缩吗? Gzip肯定不行,从我的阅读来看LZO有一些问题。
【问题讨论】:
-
Snappy 是 Spark 用于 Parquet 文件的默认压缩算法,也是另一个不错的选择。