【发布时间】:2021-11-30 19:43:09
【问题描述】:
现在我正在使用 PySpark,想知道有没有办法在行之间进行成对距离。比如有这样一个数据集。
+--------------------+------------+--------+-------+-------+
| product| Mitsubishi | Toyota | Tesla | Honda |
+--------------------+------------+--------+-------+-------+
|Mitsubishi | 0| 0.8| 0.2| 0|
|Toyota | 0| 0| 0| 0|
|Tesla | 0.1| 0.4| 0| 0.3|
|Honda | 0| 0.5| 0.1| 0|
+--------------------+------------+--------+-------+-------+
我很好奇,因为在 pandas 中我使用了 sklearn 这行代码:
from sklearn.metrics import pairwise_distances
array = df1_corr.drop(columns=['new_product_1']).values
correlation = pairwise_distances(array, array, metric = 'correlation')
PySpark 怎么样,上面有没有内置的pairwise_distance?或sparkml?
【问题讨论】:
标签: python apache-spark pyspark correlation pairwise-distance