【发布时间】:2019-12-09 07:44:29
【问题描述】:
我有一些问题
首先,我不知道如何查找和去除距离矩阵或对称矩阵中的异常值。
其次,我还使用了带有平均链接的层次聚类。
我的数据是engmale161(已经用DTW做了对称矩阵)
engmale161 <- na.omit(engmale161)
engmale161 <- scale(engmale161)
d <- dist(engmale161, method = "euclidean")
hc1_engmale161 <- hclust(d, method="average")
我发现使用轮廓、wss 和间隙优化索引 4。
>sub_grp <- cutree(hc1_engmale161,h=60, k = 4)
>table(sub_grp)
>table(sub_grp)
sub_grp
1 2 3 4
741 16 7 1
> subset(sub_grp,sub_grp==4)
4165634865
4
>fviz_cluster(list(data = engmale161, cluster = sub_grp), geom = "point")
所以,我认为右上点(4165634865)是异常值,它只有一个点。 H-C算法中如何删除异常值。
【问题讨论】:
-
嘿,也许你可以详细说明一下?我们进行聚类以查看我们的样本彼此之间的相似程度。所以你应该先进行聚类,删除你认为是异常值的点,然后重新进行聚类。为什么你更喜欢一开始就去除异常值?
-
在构造距离矩阵之前,是否有某些原因无法将其从数据中删除? 4165634865 不是为你识别吗?如果不尝试
which(subgrp==4),因为组值按原始数据的顺序列出。
标签: r