【发布时间】:2019-09-30 06:48:33
【问题描述】:
我正在尝试将具有大约 9000 万行的 pyspark 数据框列转换为 numpy 数组。
我需要数组作为scipy.optimize.minimize 函数的输入。
我尝试过转换为 Pandas 和使用 collect(),但这些方法非常耗时。
我是 PySpark 的新手,如果有更快更好的方法来做到这一点,请帮助。
谢谢
这就是我的数据框的样子。
+----------+
|Adolescent|
+----------+
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
| 0.0|
+----------+
【问题讨论】:
-
你试过
df['Adolescent'].to_numpy()或df['Adolescent'].array吗? -
看起来 to_numpy() 仅适用于 pandas 数据框,不适用于 pyspark。我尝试了 df["Adolescent"].array,它给出了输出:"Column"。我不知道如何将其用作数组。
标签: python numpy apache-spark pyspark