【问题标题】:Determination level of agglomerative hierarchy clustering凝聚层次聚类的确定水平
【发布时间】:2021-07-25 04:03:47
【问题描述】:

我将使用 AHC 对我的数据(轨迹数据)进行聚类。请告诉我如何确定 AHC 的水平?

【问题讨论】:

    标签: python cluster-analysis data-mining


    【解决方案1】:

    聚类的目标应该是聚类本身应该远离彼此,而聚类内的点应该尽可能地靠近。

    目标:这是另一种说法,我们必须最小化集群内距离并最大化集群间距离。

    为此,我们使用了各种纯度测量方法,例如:

    1. 戴维斯-博尔丁指数:https://en.wikipedia.org/wiki/Davies%E2%80%93Bouldin_index
    2. 剪影值:https://en.wikipedia.org/wiki/Silhouette_(clustering) 或者,您可以在实现 AIM 的地方提供您的功能。

    在每次迭代后,您可以计算您制作的集群的纯度,并在达到最小值时停止

    【讨论】:

    • 感谢您的回复。我熟悉外部和内部措施。你的意思是,我必须执行 AHC,然后使用这些措施来确定簇数?
    • 是的。尝试 AHC 的一次迭代,然后计算纯度。这里可以有 3 个停止标准: 1. 定义目标纯度值 - 达到时停止 AHC。缺点是您必须确定一个可能很困难的纯度值。 2. 单独存储当前集群并在当前集群的副本上重做 AHC。计算新集群的纯度。比较纯度并在纯度降低时停止。 3.直接固定迭代次数(最简单但有点随机)我个人建议第一个
    猜你喜欢
    • 2014-06-28
    • 2016-09-06
    • 2021-10-04
    • 2021-07-21
    • 2020-11-30
    • 2015-11-20
    • 2017-10-24
    • 2015-12-01
    • 1970-01-01
    相关资源
    最近更新 更多