【发布时间】:2011-11-05 15:55:57
【问题描述】:
我正在尝试与 K-Means 一起实现 Canopy 聚类算法。我在网上做了一些搜索,说要使用 Canopy 聚类来让您的初始起点输入 K-means,问题是,在 Canopy 聚类中,您需要为 Canopy 指定 2 个阈值:T1 和 T2,其中内部阈值中的点与该树冠密切相关,而较宽阈值中的点与该树冠的关联较小。这些阈值或距树冠中心的距离是如何确定的?
问题背景:
我要解决的问题是,我有一组数字,例如 [1,30] 或 [1,250],其大小约为 50。可能有重复的元素,它们可以是浮点数嗯,比如 8, 17.5, 17.5, 23, 66, ...我想找到最优的簇,或者这组数字的子集。
因此,如果使用 K-means 进行 Canopy 聚类是一个不错的选择,那么我的问题仍然存在:您如何找到 T1、T2 值?如果这不是一个好的选择,是否有更好、更简单但有效的算法可供使用?
【问题讨论】:
-
你有没有运气?我正在寻找使用 Canopy Clustering 来找到一个初始集群集以提供给 K-Means。我可能只使用here 描述的“跳转方法”(这听起来类似于@rpd 在他的回答中描述的方法),但如果你找到了确定 T1 和 T2 的好方法,我想使用 Canopy改为集群。
标签: cluster-analysis subset k-means