【问题标题】:How to give input variables in K means clustering in R如何在 K 中给出输入变量意味着 R 中的聚类
【发布时间】:2016-07-07 03:01:04
【问题描述】:

我有一个包含 29 个变量的数据集。从这个数据集中,我想使用特定的 9 个变量来制作 6 个不同的 K 均值集群。如何在 R 中创建集群时指定相关变量。我是否应该先过滤掉数据并使用该数据来制作集群?

提前致谢!

【问题讨论】:

    标签: r cluster-analysis k-means


    【解决方案1】:

    我假设您有一个包含 n 行(样本数)和 29 列(每个样本的变量数)的矩阵。现在,您需要做的是“特征选择”,其中每个变量都是一个特征。使用特征选择,您将能够识别导致数据可变性的特征。不过,如果您能告知您为什么只需要 9 个功能,那就太好了。无论如何,关于功能选择,这可能会有所帮助: http://www.r-bloggers.com/introduction-to-feature-selection-for-bioinformaticians-using-r-correlation-matrix-filters-pca-backward-selection/

    如果最终目标是对数据进行聚类,那么我建议您先进行 PCA 并尝试降低数据的维数,然后再进行聚类。同样,如果您告知您为什么只需要 6 个集群,那就太好了。

    【讨论】:

    • 谢谢@Manish。问题是我们正在使用一个工具 Statistica 进行聚类,现在我正在尝试使用 R 模拟结果。我已经知道我需要制作总共 6 个聚类(已经定义),并且我也知道哪些变量对聚类很重要。我只是想知道如何在制作集群时进行变量选择。
    • 据我了解,变量选择和聚类是两个独立的任务。所以,我建议不要混合它们。
    【解决方案2】:

    构建一个子集数据框,包含您想要使用的那些特征。

    然后只在这些列上运行 k-means。

    您可以轻松地将索引映射回原始(完整)数据。

    【讨论】:

    • 感谢 Anony,这也是我现在正在做的事情。我只是想确认这是否是正确的方法。
    猜你喜欢
    • 2018-01-22
    • 2013-05-17
    • 2020-09-06
    • 2019-04-23
    • 2017-08-28
    • 2020-08-17
    • 2018-11-28
    • 2018-01-30
    • 2014-07-23
    相关资源
    最近更新 更多