【发布时间】:2018-09-27 18:13:58
【问题描述】:
我有一个 PySpark 数据帧 df1,它看起来像:
CustomerID CustomerValue CustomerValue2
12 .17 .08
我有第二个 PySpark DataFrame,df2
CustomerID CustomerValue CustomerValue
15 .17 .14
16 .40 .43
18 .86 .09
我想取两个数据帧的余弦相似度。并且有类似的东西
CustomerID CustomerID CosineCustVal CosineCustVal
15 12 1 .90
16 12 .45 .67
18 12 .8 .04
【问题讨论】:
-
很遗憾,但它无法正常工作。我认为的另一个解决方案是转换列表中的第一个 df 并采用余弦相似度,但我想避免这种方式
-
您的第一个数据框只有一行?此外,这是您决定加入两者的共同列,因为
CustomerID没有任何共同值。 -
是的,它只有一行。问题是我不想加入这两个 dfs,因为他们确实没有相同的 CustomerID @mayankagrawal
-
如果只有一行,最好把它收集成列表或类似的结构,然后计算。无需为单行创建 spark 数据框。
标签: python apache-spark pyspark apache-spark-sql