【问题标题】:How to read and write compressed sequence file in spark using Python with any supported compression codec如何使用 Python 和任何支持的压缩编解码器在 Spark 中读取和写入压缩序列文件
【发布时间】:2018-10-04 16:50:33
【问题描述】:

如何使用 Python 在 Spark 中读写压缩的SequenceFile。

我在带有 Python 2.7 的 CDH 5.12 Quickstart VM 上使用 Spark 1.6

找到如下示例,但不起作用。

rdd.saveAsSequenceFile(<path location>, Some(classOf[compressionCodecClass]))

sparkContext.sequenceFile(<path location>, classOf[<class name>], classOf[<compressionCodecClass >]);

需要工作代码进行测试。

【问题讨论】:

    标签: pyspark compression sequencefile


    【解决方案1】:

    要在 Pyspark 中读取压缩的 sequencefile,请使用以下代码:

    `myRDD = sparkcontext.sequenceFile("FILE_PATH")`
    

    在 Hadoop 中,我们可以在 core-site.xml 文件中找到各种支持的压缩编解码器。

    一些受欢迎的有:

    org.apache.hadoop.io.compress.DefaultCodec
    org.apache.hadoop.io.compress.GzipCodec
    org.apache.hadoop.io.compress.BZip2Codec
    org.apache.hadoop.io.compress.DeflateCodec
    org.apache.hadoop.io.compress.SnappyCodec
    org.apache.hadoop.io.compress.Lz4Codec
    

    要在 Pyspark 中使用任何这些压缩编解码器编写 Sequencefile,请使用以下代码(用于 GzipCodec): MYrdd.saveAsSequenceFile("FILE_PATH","org.apache.hadoop.io.compress.GzipCodec")

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-11-15
      相关资源
      最近更新 更多