【问题标题】:Hierarchical Cluster Analysis in Cluster 3.0Cluster 3.0 中的层次聚类分析
【发布时间】:2013-07-16 06:20:22
【问题描述】:

我是这个网站的新手,也是聚类分析的新手,所以如果我违反约定,我深表歉意。

我一直在使用 Cluster 3.0 执行具有欧几里得距离和平均链接的层次聚类分析。 Cluster 3.0 输出一个 .gtr 文件,其中包含一个连接基因的节点及其相似度得分。我注意到 .gtr 文件中的第一行总是将一个基因与另一个基因联系起来,然后是相似度得分。但是,我如何重现这个相似度分数?

在我的数据集中,我有 8 个基因并创建一个距离矩阵,其中 d_{ij} 包含基因 i 和基因 j 之间的欧几里得距离。然后我通过将每个元素除以矩阵中的最大值来归一化矩阵。为了得到相似度矩阵,我从 1 中减去所有元素。但是,我的结果没有使用链接类型,并且与输出相似度得分不同。

我主要困惑的是链接如何影响第一个节点的相似性(两个最接近的基因的连接)以及如何计算相似性分数。

谢谢!

【问题讨论】:

  • Cluster 3.0 使用了哪种相似度函数,它是如何预先对数据进行预处理(缩放!)的?

标签: cluster-analysis hierarchical-clustering


【解决方案1】:

该算法使用某种链接方法而不是数据点来比较。然而,在算法的第一次迭代中,每个数据点都形成了自己的集群;这意味着您的链接方法实际上已简化为用于测量数据点之间距离的度量(对于您的情况是欧几里得距离)。对于后续迭代,将根据您的链接方法测量集群之间的距离,在您的情况下是平均链接。对于两个集群AB,计算如下:

其中d(a,b) 是两个数据点之间的欧几里得距离。说服自己,当 AB 只包含一个数据点(如在第一次迭代中)时,这个等式将自身简化为 d(a,b)。我希望这能让事情更清楚一些。如果不是,请提供更多详细信息,说明您究竟想要做什么。

【讨论】:

    猜你喜欢
    • 2018-10-22
    • 2013-11-11
    • 1970-01-01
    • 2010-09-10
    • 2021-03-10
    • 2013-05-08
    • 2021-11-16
    • 2018-10-04
    • 2015-01-31
    相关资源
    最近更新 更多