【发布时间】:2019-10-05 04:15:31
【问题描述】:
我有一个 SparkSQL 数据框和 2D numpy 矩阵。它们具有相同的行数。我打算将 numpy 矩阵中的每个不同数组作为新列添加到现有的 PySpark 数据框中。这样每一行添加的列表就不同了。
例如,PySpark 数据框是这样的
| Id | Name |
| ------ | ------ |
| 1 | Bob |
| 2 | Alice |
| 3 | Mike |
而numpy矩阵是这样的
[[2, 3, 5]
[5, 2, 6]
[1, 4, 7]]
生成的预期数据框应该是这样的
| Id | Name | customized_list
| ------ | ------ | ---------------
| 1 | Bob | [2, 3, 5]
| 2 | Alice | [5, 2, 6]
| 3 | Mike | [1, 4, 7]
Id 列对应于 numpy 矩阵中条目的顺序。
我想知道有没有有效的方法来实现这个?
【问题讨论】:
-
Id列是否与numpy矩阵中的条目顺序相对应? -
是的,会在描述中添加
标签: apache-spark pyspark apache-spark-sql pyspark-sql