【发布时间】:2016-07-15 09:39:47
【问题描述】:
我们正在获取各种 JSON/XML 作为输入,其中模式总是在不断发展。我想在 Hadoop/Hive 环境中使用 ORC 或 Parquet 格式处理它们以提高性能。
我知道以下实现相同目标的常见方式: 使用 JSONSerde 或 XMLSerde 库,首先使用这些 serde 创建 hive 表。稍后将在每个 xml/json 配置单元表上触发 select * fields 查询以另存为 orc 或另存为镶木地板到另一个表中。成功完成后,我可以删除这些 Serde 表和 XML/JSON 数据。
还有什么好的方法可以做同样的事情?
【问题讨论】:
标签: apache-spark apache-spark-sql spark-dataframe parquet orc