【问题标题】:Convert schema evolving (SCD) JSON/XML into ORC/Parquet format将模式演化 (SCD) JSON/XML 转换为 ORC/Parquet 格式
【发布时间】:2016-07-15 09:39:47
【问题描述】:

我们正在获取各种 JSON/XML 作为输入,其中模式总是在不断发展。我想在 Hadoop/Hive 环境中使用 ORC 或 Parquet 格式处理它们以提高性能。

我知道以下实现相同目标的常见方式: 使用 JSONSerde 或 XMLSerde 库,首先使用这些 serde 创建 hive 表。稍后将在每个 xml/json 配置单元表上触发 select * fields 查询以另存为 orc 或另存为镶木地板到另一个表中。成功完成后,我可以删除这些 Serde 表和 XML/JSON 数据。

还有什么好的方法可以做同样的事情?

【问题讨论】:

    标签: apache-spark apache-spark-sql spark-dataframe parquet orc


    【解决方案1】:

    正如您所建议的,这是将 JSON/XML 数据离线转换为 parquet 格式的最常用方法。 但另一种方法可能是解析 JSON/XML 并为每个 JSON 记录创建 Parquet 组。本质上:

    打开 JSON 文件 阅读每条记录 打开另一个文件 从 #2 中读取的记录创建 Parquet Group 将 parquet 组写入 #3 中创建的文件 对文件中的所有记录执行此操作 关闭这两个文件。

    我们为我们的一个用例想出了这样一个转换器。

    【讨论】:

      猜你喜欢
      • 2021-07-18
      • 2011-06-14
      • 2011-07-04
      • 2014-06-22
      • 2014-09-03
      • 2020-08-30
      • 2020-05-10
      • 2019-07-01
      相关资源
      最近更新 更多