【问题标题】:How to analyse the graph result of affinity propagation clustering in R?如何分析R中亲和传播聚类的图结果?
【发布时间】:2018-11-17 06:00:15
【问题描述】:

我已经安装了 R 的亲和传播集群包并阅读了decomentation。虹膜数据聚类的基本脚本是:

data(iris)
apIris1 <- apcluster(negDistMat(r=2), iris)
apIris1

使用此代码,形成了六个集群。此外,可以使用以下代码以图形方式查看结果:

plot(apIris1, iris)

生成的图如下:

关于该图的可用信息是:每种颜色对应一个簇。每个集群的示例由 盒子和所有集群成员都用线连接到他们的样本。 还有其他方法可以分析这个图吗?例如:每个大盒子之间有什么区别(包含彩色数据) 包含六个簇?它们之间的关系是什么?当我尝试仅使用 plot(iris) 绘制数据时,会生成相同的图,但没有颜色(黑点)且没有聚类。如何分析数据图?

此外,可以使用heatmap(apIris1) 生成热图,如下所示:

如上图所示,顶部和左侧的不同颜色表示集群的总数。 如何详细分析这个情节?

请帮忙!

抱歉,帖子太长了!

更新:

这里,由1、3和4连接的大框(不包括具有特征名称的框)具有相似的数据分布,分别。然而,由 2 连接的盒子具有镜像分布。这种不同的数据分布真正说明了什么?如果只有一个大箱线图,那将很容易可视化。但是,具有不同数据分布/模式的框让我感到困惑。我们可以将每一行或每一列与其各自的特征名称相关联吗?

【问题讨论】:

  • 您提出的问题范围很广。尝试缩小范围。让我问你,“为什么你手头的问题需要亲和力传播方法?”
  • 亲和传播聚类有助于降低我工作中的计算复杂度。我想在使用它之前更详细地分析它。
  • 如果计算复杂度降低是标准,那么为什么不尝试主成分分析(PCA),一种降维技术?
  • @Ashish 我对在工作中使用 APC 有自己的要求。请您帮忙详细说明一下图表吗?
  • 就像我之前所说的,您提出的问题在上下文中过于宽泛。通过问你所有这些问题,我试图缩小焦点。但似乎你有自己的理由。除非提出的问题是重点突出的,否则很抱歉,我无能为力。

标签: r cluster-analysis


【解决方案1】:

你有四维数据。

图中的每个“大框”都对应于数据的二维视图,基于仅选择 2 个特征作为 x 和 y。

热图更适合分层聚类。你可以看到簇是一致的(白色),但也有一些不同的簇大多是白色的(蓝色和青色的交集),所以它们分离得不是很好。

【讨论】:

  • 感谢您的回答。四维数据是否意味着四个特征?我仍然对“大盒子”的信息感到困惑。请参阅问题的更新。
  • 是的,四个功能。它们标记在对角线框中。是的,在这个数据集中,萼片特征有点相似,花瓣特征也有点相似......如果你交换 x 和 y 轴,那么是的,你得到一个镜像结果......
【解决方案2】:

我不知道apcluster 背后的理论如何,以及negDistMat() 做了什么,但我会打电话

apIris1 &lt;- apcluster(negDistMat(r=6), iris[,1:4])

然后你会出于某种原因得到 三个 簇(你应该这样做,因为有 3 个物种),然后使用

将簇分配与实际标签进行比较
library(purrr)
nclust       <- map_dbl(apIris1@clusters, length) %>%  length()
iris$cluster <- map_dbl(apIris1@clusters, length) %>%  rep(1:nclust, .)

#visually compare two pairplots by switching back and forth in RStudio
pairs(iris[,1:4], col=factor(iris$cluster))
pairs(iris[,1:4], col=factor(iris$Species))

【讨论】:

    猜你喜欢
    • 2019-10-15
    • 2017-06-19
    • 2019-09-28
    • 2014-01-24
    • 2021-03-10
    • 1970-01-01
    • 2017-12-01
    • 2014-01-19
    • 2016-06-02
    相关资源
    最近更新 更多