【发布时间】:2018-10-27 00:27:47
【问题描述】:
我在 pyspark 数据框中有以下列,类型为 Array[Int]。
+--------------------+
| feature_indices|
+--------------------+
| [0]|
|[0, 1, 4, 10, 11,...|
| [0, 1, 2]|
| [1]|
| [0]|
+--------------------+
我试图用零填充数组,然后限制列表长度,以便每一行数组的长度相同。例如,对于 n = 5,我期望:
+--------------------+
| feature_indices|
+--------------------+
| [0, 0, 0, 0, 0]|
| [0, 1, 4, 10, 11]|
| [0, 1, 2, 0, 0]|
| [1, 0, 0, 0, 0]|
| [0, 0, 0, 0, 0]|
+--------------------+
有什么建议吗?我查看了 pyspark rpad 函数,但它只对字符串类型的列起作用。
【问题讨论】: