【发布时间】:2019-11-04 14:58:08
【问题描述】:
我有一本像这样的字典:
my_dict = {'Community A': ['User 1', 'User 2', 'User 3'],
'Community B': ['User 1', 'User 2'],
'Community C': ['User 3', 'User 4', 'User 5'],
'Community D': ['User 1', 'User 3', 'User 4', 'User 5']}
我的目标是对不同社区及其独特用户集之间的网络关系进行建模,以查看哪些社区最相似。目前,我正在探索使用 Jaccard 相似度。
我遇到过执行类似操作的答案,但仅在 2 个字典上;就我而言,我有几个,并且需要计算每组之间的相似性。
此外,一些列表的长度不同:在其他答案中,我看到 0 sub in 在这种情况下是一个缺失值,我认为这对我的情况有效。
【问题讨论】:
-
Jaccard 通常是成对的......这里可能有一些想法stackoverflow.com/questions/2035326/…
标签: python dictionary data-science similarity