【发布时间】:2015-12-10 14:04:17
【问题描述】:
所以我使用以下代码将 spark RDD 保存到 S3 存储桶。有没有办法压缩(以gz格式)并保存而不是将其保存为文本文件。
help_data.repartition(5).saveAsTextFile("s3://help-test/logs/help")
【问题讨论】:
标签: python apache-spark pyspark
所以我使用以下代码将 spark RDD 保存到 S3 存储桶。有没有办法压缩(以gz格式)并保存而不是将其保存为文本文件。
help_data.repartition(5).saveAsTextFile("s3://help-test/logs/help")
【问题讨论】:
标签: python apache-spark pyspark
saveAsTextFile 方法采用一个可选参数,指定压缩编解码器类:
help_data.repartition(5).saveAsTextFile(
path="s3://help-test/logs/help",
compressionCodecClass="org.apache.hadoop.io.compress.GzipCodec"
)
【讨论】: