【发布时间】:2017-04-29 02:15:38
【问题描述】:
我想知道其他人在用 K-means 集群排序做什么。我正在制作热图(主要是 ChIP-Seq 数据)并使用自定义热图函数(基于 R 的内置热图函数)获得漂亮的数字。但是,我想要两个改进。首先是根据递减的平均值对我的集群进行排序。比如下面的代码:
fit = kmeans(data, 8, iter.max=50, nstart=10)
d = data.frame(data, symbol)
d = data.frame(d, fit$cluster)
d = d[order(d$fit.cluster),]
给我一个按簇列排序的 data.frame。对行进行排序以使 8 个集群按其各自均值的顺序排列的最佳方法是什么?
其次,您是否建议将每个集群内的行从最高平均值排序到最低值?这将对数据施加更有条理的外观,但可能会欺骗不谨慎的观察者来推断他可能不应该的东西。如果你推荐这个,你会怎么做最有效?
【问题讨论】:
-
是什么意思?用于聚类或其他什么的变量之一?
-
每个集群中的值的平均值。例如,如果每个集群在 data.frame 中有 30 行,并且 data.frame 有 10 列执行 k-means 聚类,我想要每个集群中 300 个值的平均值。也可以使用质心。
-
质心不是每个簇的数字,它是 10 维空间中的一个点,因此每个簇质心有 10 个坐标。
标签: r