如果 Spark 数据帧不是很大,您可以使用 toPandas() 将其转换为 pandas 数据帧并使用 scipy.spatial.distance.cdist()(阅读 this 了解更多信息)
示例代码:
import pandas as pd
from scipy.spatial.distance import cdist
cluster = DataFrame({'cluster_id': [1, 2, 3, 7],
'dim1_pos': [201, 204, 203, 204],
'dim2_pos':[55, 40, 84, 31]})
entity = DataFrame({'entity_id': ['A', 'B', 'C'],
'dim1_pos': [201, 204, 203],
'dim2_pos':[55, 40, 84]})
cluster.set_index('cluster_id',inplace=True)
entity.set_index('entity_id',inplace=True)
result_metric= cdist(cluster, entity, metric='euclidean')
result_df = pd.DataFrame(result_metric,index=cluster.index.values,columns=entity.index.values)
print result_df
A B C
1 0.000000 15.297059 29.068884
2 15.297059 0.000000 44.011362
3 29.068884 44.011362 0.000000
7 24.186773 9.000000 53.009433
然后您可以使用idxmin() 指定轴 来从指标的每一行中找到最小对,如下所示:
# get the min. pair
result = DataFrame(result_df.idxmin(axis=1,skipna=True))
# turn the index value into column
result.reset_index(level=0, inplace=True)
# rename and order the columns
result.columns = ['cluster_id','entity_id']
result = result.reindex(columns=['entity_id','cluster_id'])
print result
entity_id cluster_id
0 A 1
1 B 2
2 C 3
3 B 7