【发布时间】:2016-07-07 03:01:04
【问题描述】:
我有一个包含 29 个变量的数据集。从这个数据集中,我想使用特定的 9 个变量来制作 6 个不同的 K 均值集群。如何在 R 中创建集群时指定相关变量。我是否应该先过滤掉数据并使用该数据来制作集群?
提前致谢!
【问题讨论】:
标签: r cluster-analysis k-means
我有一个包含 29 个变量的数据集。从这个数据集中,我想使用特定的 9 个变量来制作 6 个不同的 K 均值集群。如何在 R 中创建集群时指定相关变量。我是否应该先过滤掉数据并使用该数据来制作集群?
提前致谢!
【问题讨论】:
标签: r cluster-analysis k-means
我假设您有一个包含 n 行(样本数)和 29 列(每个样本的变量数)的矩阵。现在,您需要做的是“特征选择”,其中每个变量都是一个特征。使用特征选择,您将能够识别导致数据可变性的特征。不过,如果您能告知您为什么只需要 9 个功能,那就太好了。无论如何,关于功能选择,这可能会有所帮助: http://www.r-bloggers.com/introduction-to-feature-selection-for-bioinformaticians-using-r-correlation-matrix-filters-pca-backward-selection/
如果最终目标是对数据进行聚类,那么我建议您先进行 PCA 并尝试降低数据的维数,然后再进行聚类。同样,如果您告知您为什么只需要 6 个集群,那就太好了。
【讨论】:
构建一个子集数据框,仅包含您想要使用的那些特征。
然后只在这些列上运行 k-means。
您可以轻松地将索引映射回原始(完整)数据。
【讨论】: