【发布时间】:2019-09-21 00:14:46
【问题描述】:
我在同一数据集上比较了不同聚类算法的轮廓宽度:k-means、clara 和 pam。我可以看到哪一个在轮廓宽度上得分最高。但是我现在可以像我们通常对 ANOVA 所做的那样,在统计上测试解决方案是否彼此不同吗?
我为我的论文提出了一个假设,即 clara 和 pam 会给出比 k-means 更有效的结果。我知道他们两个的轮廓宽度都更高,但我不知道如何在统计上证实/否定我的假设。
#######4: Behavioral Clustering
##4.1 Kmeans
kmeans.res.4.1 <- kmeans(ClusterDFSBeha, 2)
print(kmeans.res.4.1)
#Calculate SW
library(clValid)
intern4.1 <- clValid(ClusterDFSBeha, 2, clMethods="kmeans",validation="internal", maxitems = 9800)
summary(intern4.1)
#Silhouette width = 0.7861
##4.2 PAM
pam.res.4.2 <- pam(ClusterDFSBeha, 2)
print(pam.res.4.2)
intern4.2 <- clValid(ClusterDFSBeha, 2, clMethods="pam", validation="internal", maxitems = 9800)
summary(intern4.2)
#Silhouette width = 0.6702
##4.3 Clara
clara.res.4.3 <- clara(ClusterDFSBeha,2)
print(clara.res.4.3)
intern4.3 <- clValid(ClusterDFSBeha, 2, clMethods="clara", validation="internal", maxitems = 9800)
summary(intern4.3)
#Silhouette width = 0.8756
现在我想从统计学上评估这些方法是否在统计学上“不同”,以便能够在某个 p 水平上拒绝或批准我的假设。
【问题讨论】:
标签: r compare cluster-analysis