【发布时间】:2023-03-14 11:15:01
【问题描述】:
我正在从 Kafka 读取数据并加载到数据仓库中,我是从一个 Kafka 主题 创建一个数据框并在应用所需的转换后,我从中创建多个 DF 并将这些 DF 加载到不同的表中,但是此操作是按顺序进行的。有没有办法可以并行化这个表加载过程?
root
|-- attribute1Formatted: array (nullable = true)
| |-- element: struct (containsNull = true)
| | |-- accexecattributes: struct (nullable = true)
| | | |-- id: string (nullable = true)
| | | |-- name: string (nullable = true)
| | | |-- primary: boolean (nullable = true)
| | |-- accountExecUUID: string (nullable = true)
|-- attribute2Formatted: struct (nullable = true)
| |-- Jake-DOT-Sandler@xyz.com: struct (nullable = true)
| | |-- id: string (nullable = true)
| | |-- name: string (nullable = true)
| | |-- primary: boolean (nullable = true)
分别为attribute1Formatted和attribute2Formatted创建了两个不同的数据框,并且这些DF被保存到不同表中的数据库中。
【问题讨论】:
-
您可以发布您正在使用的代码吗?火花部分,简化输出业务部分
标签: scala dataframe apache-kafka spark-structured-streaming