【发布时间】:2020-08-10 06:20:05
【问题描述】:
我有一个使用 Pipeline 对象创建的数据框,如下所示:
df.show()
+--------------------+-----+
| features|label|
+--------------------+-----+
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
|[-0.0775219322931...| 0|
+--------------------+-----+
我已经成功提取了这样的特征向量:
df_table = df.rdd.map(lambda x: [float(y) for y in x['features']]).toDF(cols)
上面的问题是它没有保留标签列。作为一种解决方法,我成功地使用了 Join 来恢复该标签列,但我发现它太复杂了。
我将如何使用像上面这样的单线来提取特征向量并从中制作 Spark DF,同时将标签列附加到它上面?
【问题讨论】:
标签: python dataframe apache-spark vector pyspark