【问题标题】:R: Clustering validation methods (mixed data)R:聚类验证方法(混合数据)
【发布时间】:2018-03-14 06:46:42
【问题描述】:

我使用 k-prototype 和 PAM 两种聚类方法对包含数字和分类特征 (heart dataset from UCI) 的混合数据集进行了聚类

我的问题是:如何验证聚类结果?

我在 R 中发现了不同的方法,例如 Rand Index、SSE、Purity、clValid、pvclust,它们都适用于数字数据。

有什么方法可以在混合数据的情况下使用

【问题讨论】:

    标签: r validation cluster-analysis


    【解决方案1】:

    是的,您可以将聚类结果与 CV 索引进行比较。更多你可以阅读这个 Cv index CV 公式包含用于分类属性的 CU(Category Utility)和用于数字属性的 varians

    【讨论】:

      【解决方案2】:

      您仍然可以使用调整后的兰德指数。该索引仅比较两个分区。分区是从分类特征还是连续特征构建的并不重要

      【讨论】:

      • 感谢您的澄清。
      • 使用调整兰德指数 (ARI) 比使用兰德指数更好。确实,用两个自变量计算的 ARI 的期望值为零(兰德指数不是这样)......
      【解决方案3】:

      您特别研究了多少个观测值 (n) 和维度 (d)? 可能您属于 n>>d 案例,但最近 d>>n 是一个热门话题。

      变量选择是需要事先完成的。检查特征相关性,这可能会影响您检测到的集群数量。如果特征是相关的并且它们恰好是线性的,则可以使用梯度而不是两个变量。

      您的问题没有绝对的答案。因此存在许多方法。聚类本质上是探索性的。您对数据了解得越多,您就可以更好地设计测试。

      需要定义您要测试的内容:分区的稳定性,或者集群配方的稳定性。有不同的方法来处理这些问题中的每一个。对于第一个,重采样是一个关键,对于第二个,通常使用比较索引来衡量在某个分区中遗漏了多少观察。

      推荐阅读:

      [1]梅拉,M.(2016 年)。比较聚类的标准。聚类分析手册。 C. Hennig、M. Meil​​a、F. Murtagh 和 R. Rocci:619-635。

      [2]Leisch, F. (2016)。探索集群稳定性的重采样方法。聚类分析手册。 C. Hennig、M. Meil​​a、F. Murtagh 和 R. Rocci:637-652。

      【讨论】:

        猜你喜欢
        • 2020-02-09
        • 1970-01-01
        • 1970-01-01
        • 2019-11-12
        • 2016-10-03
        • 2019-11-21
        • 1970-01-01
        • 1970-01-01
        • 2020-11-05
        相关资源
        最近更新 更多