【发布时间】:2019-06-30 19:44:31
【问题描述】:
我在尝试使用我已经拥有的某种文化相关性对国家/地区进行聚类时遇到了一些问题。
基本上,数据集如下所示:包含 90 个国家/地区,91 列(90 个国家/地区列 + 1 个用于识别行中的国家/地区) 和 90 行
Nation Ita Fra Ger Esp Eng ...
Ita NA 0.2 0.1 0.6 0.4 ...
Fra 0.2 NA 0.2 0.1 0.3 ...
Ger 0.7 0.1 NA 0.5 0.4
Esp 0.6 0.1 0.5 NA 0.2
Eng 0.4 0.3 0.4 0.2 NA
... .....
...
我正在寻找一种算法,将我的国家/地区分组(例如 3 个组,甚至更好、更灵活的集群,这样集群的数量和每个集群的国家/地区数量不是事先固定的
这样输出就是例如
Nation cluster
Ita 1
Fra 2
Ger 3
Esp 1
Eng 3
......
【问题讨论】:
-
引人注目的是,
cultural correlation(或者,从标题,similarity)矩阵是不对称的。 -
你可以接受这个声明吗:
similarity = 1 - distance?
标签: r algorithm machine-learning cluster-analysis hierarchical-clustering