【问题标题】:cluster::daisy drops labelscluster::daisy 丢弃标签
【发布时间】:2020-10-23 00:54:47
【问题描述】:

我正在尝试使用 cluster::daisy 函数和相异矩阵对数据进行聚类。数据如下图所示。

> head(score_mat_unique_3)
         ID_1       ID_2    Score
1: 1000035849 1000532512 2.49e-60
2: 1000035849 1000682765 3.87e-08
3: 1000086994 1000658924 8.90e-18
4: 1000234640 1000535109 1.20e-87
5: 1000235015 1000754236 6.29e-34
6: 1000258002 1000598768 8.34e-36

分数显示了对象的不同程度(值越大,对象越多。),所以我使用了相异矩阵和菊花函数。

diss3 <- daisy(score_mat_unique_3, metric = "gower")

但是当我尝试绘制 hclust 时,会打印一些数字而不是 ID。

fit3 <- hclust(diss3, method = "ward.D2")
plot(fit3)

因此,关于簇中对象的信息丢失了。如何返回有关初始 ID 的信息并了解集群中的哪些 ID?

【问题讨论】:

    标签: r cluster-analysis hierarchical-clustering r-daisy


    【解决方案1】:

    您只需将labels 参数用于plot。由于您不提供数据,我将使用内置的虹膜数据进行说明。

    DAT = iris[sample(26),1:4]
    fit3 = hclust(dist(DAT))
    
    plot(fit3, labels=LETTERS)
    

    你的情况,试试plot(fit3, labels=score_mat_unique_3$ID_1)

    【讨论】:

    • 谢谢!它适用于情节。但是如何在变量(或文件)中写入每个集群中的 ID?我使用groups &lt;- cutree(fit3, k=6) groups_rected &lt;- rect.hclust(fit3, k=6, border="red") 并尝试查看groups_rected,但这里又写了数字而不是ID,如图所示。
    猜你喜欢
    • 1970-01-01
    • 2014-12-10
    • 1970-01-01
    • 2021-10-15
    • 2012-05-17
    • 2018-04-20
    • 1970-01-01
    • 1970-01-01
    • 2015-05-17
    相关资源
    最近更新 更多