【问题标题】:Apache Hudi Partitioning with custom format具有自定义格式的 Apache Hudi 分区
【发布时间】:2020-04-08 21:58:54
【问题描述】:

我目前正在使用 spark(scala) 在 Apache Hudi 上进行 POC。

我在使用分区保存数据帧时遇到问题。

Hudi 使用path/valueOfPartitionCol1/valueOfPartitionCol2.... 保存数据帧 使用属性PARTITIONPATH_FIELD_OPT_KEY。

但我的要求是 path/COL1=value/COL2=value.... 类似于 spark 使用 partitionBy() 对数据进行分区的方式。

任何尝试过使用Hudi 进行自定义分区的人可以帮助我吗?

【问题讨论】:

    标签: apache-spark apache-hudi


    【解决方案1】:

    这有帮助吗? 设置配置 HIVE_STYLE_PARTITIONING_OPT_KEY=true 如下:

      batchDF.write.format("org.apache.hudi")
    
              .option(HIVE_STYLE_PARTITIONING_OPT_KEY, true)
    
              .mode(SaveMode.Append)
              .save(bathPath)
    

    【讨论】:

      【解决方案2】:

      您可以创建KeyGenerator 类的自定义实现,实现override def getKey(record: GenericRecord): HoodieKey 类。在这个方法中,你得到一个GenericRecord 的实例并返回一个HoodieKey() 的类,它允许你定义你的自定义逻辑来生成路径分区

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多