【发布时间】:2018-05-23 09:50:52
【问题描述】:
我的目标是在 spark/Hadoop 中准备一个数据框,我将在 elasticsearch 中对其进行索引。
我有 2 个兽人桌:client 和 person。关系是一对多的
1 个客户可以有多个人。
所以我将使用 Spark/Spark SQL,让我们来说说数据帧:
客户端数据框架构:
root
|-- client_id: string (nullable = true)
|-- c1: string (nullable = true)
|-- c2: string (nullable = true)
|-- c3: string (nullable = true)
人员数据框架构:
root
|-- person_id: string (nullable = true)
|-- p1: string (nullable = true)
|-- p2: string (nullable = true)
|-- p3: string (nullable = true)
|-- client_id: string (nullable = true)
我的目标是生成一个具有此架构的数据框:
root
|-- client_id: string (nullable = true)
|-- c1: string (nullable = true)
|-- c2: string (nullable = true)
|-- c3: string (nullable = true)
|-- persons: array (nullable = true)
| |-- element: struct (containsNull = true)
| | |-- person_id: string (nullable = true)
| | |-- p1: string (nullable = true)
| | |-- p2: string (nullable = true)
| | |-- p3: string (nullable = true)
我怎样才能做到这一点?
提前感谢您的帮助。
【问题讨论】:
标签: scala apache-spark apache-spark-sql hiveql