【发布时间】:2014-06-08 04:36:48
【问题描述】:
我是集群新手,正在做一些关于集群推文的小项目,我使用了 TF-IDF,然后是层次集群。我对设置层次聚类的阈值感到困惑。它的价值应该是什么以及如何决定它?
我使用 python scikit 模块来实现。
【问题讨论】:
标签: python machine-learning cluster-analysis scikit-learn hierarchical-clustering
我是集群新手,正在做一些关于集群推文的小项目,我使用了 TF-IDF,然后是层次集群。我对设置层次聚类的阈值感到困惑。它的价值应该是什么以及如何决定它?
我使用 python scikit 模块来实现。
【问题讨论】:
标签: python machine-learning cluster-analysis scikit-learn hierarchical-clustering
我假设您正在谈论从层次聚类算法中选择要提取的聚类数量。有几种方法可以做到这一点,并且有一篇关于它的很好的维基百科文章关于一些理论:http://en.wikipedia.org/wiki/Determining_the_number_of_clusters_in_a_data_set
有关实际示例,请查看以下问题:Tutorial for scipy.cluster.hierarchy
【讨论】:
虽然存在多种方法可以帮助终止层次聚类(或一般聚类),但没有最好的通用方法来执行此操作。这是因为没有“正确”的任意数据聚类。相反,“正确性”是非常特定于领域和应用程序的。
因此,虽然您可以尝试不同的方法(例如,肘部或其他方法),但它们将拥有自己的参数,您必须“调整”这些参数以获得您认为“正确”的聚类。该视频可能对您有所帮助(虽然它主要处理 k-means,但这些概念扩展到其他聚类方法) - https://www.youtube.com/watch?v=3JPGv0XC6AE
【讨论】: