【发布时间】:2018-02-19 01:49:44
【问题描述】:
我发现很难将 parquet 文件加载到 hive 表中。我正在使用 Amazon EMR 集群和 spark 进行数据处理。但我需要阅读输出 parquet 文件来验证我的转换。我有以下架构的镶木地板文件:
root
|-- ATTR_YEAR: long (nullable = true)
|-- afil: struct (nullable = true)
| |-- clm: struct (nullable = true)
| | |-- amb: struct (nullable = true)
| | | |-- L: string (nullable = true)
| | | |-- cdTransRsn: string (nullable = true)
| | | |-- dist: struct (nullable = true)
| | | | |-- T: string (nullable = true)
| | | | |-- content: double (nullable = true)
| | | |-- dscStrchPurp: string (nullable = true)
| | |-- amt: struct (nullable = true)
| | | |-- L: string (nullable = true)
| | | |-- T: string (nullable = true)
| | | |-- content: double (nullable = true)
| | |-- amtTotChrg: double (nullable = true)
| | |-- cdAccState: string (nullable = true)
| | |-- cdCause: string (nullable = true)
如何使用这种类型的模式创建 hive 外部表并将 parquet 文件加载到该 hive 表中进行分析?
【问题讨论】:
标签: apache-spark hive schema external parquet