【问题标题】:Threshold in Hierarchial clustering层次聚类中的阈值
【发布时间】:2014-06-08 04:36:48
【问题描述】:

我是集群新手,正在做一些关于集群推文的小项目,我使用了 TF-IDF,然后是层次集群。我对设置层次聚类的阈值感到困惑。它的价值应该是什么以及如何决定它?
我使用 python scikit 模块来实现。

【问题讨论】:

    标签: python machine-learning cluster-analysis scikit-learn hierarchical-clustering


    【解决方案1】:

    我假设您正在谈论从层次聚类算法中选择要提取的聚类数量。有几种方法可以做到这一点,并且有一篇关于它的很好的维基百科文章关于一些理论:http://en.wikipedia.org/wiki/Determining_the_number_of_clusters_in_a_data_set

    有关实际示例,请查看以下问题:Tutorial for scipy.cluster.hierarchy

    【讨论】:

      【解决方案2】:

      虽然存在多种方法可以帮助终止层次聚类(或一般聚类),但没有最好的通用方法来执行此操作。这是因为没有“正确”的任意数据聚类。相反,“正确性”是非常特定于领域和应用程序的。

      因此,虽然您可以尝试不同的方法(例如,肘部或其他方法),但它们将拥有自己的参数,您必须“调整”这些参数以获得您认为“正确”的聚类。该视频可能对您有所帮助(虽然它主要处理 k-means,但这些概念扩展到其他聚类方法) - https://www.youtube.com/watch?v=3JPGv0XC6AE

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2013-05-08
        • 2018-10-04
        • 2014-06-28
        • 2020-12-18
        • 2015-04-24
        • 2015-07-22
        • 1970-01-01
        • 2018-09-05
        相关资源
        最近更新 更多