【发布时间】:2017-06-02 01:39:06
【问题描述】:
我搜索了很多,但找不到 Cure 算法的缺点。 Cure聚类算法有什么限制吗?
谢谢
【问题讨论】:
标签: algorithm cluster-analysis
我搜索了很多,但找不到 Cure 算法的缺点。 Cure聚类算法有什么限制吗?
谢谢
【问题讨论】:
标签: algorithm cluster-analysis
从 Wikipedia Article 上的治愈算法中得到这个解释
简短的回答是运行时复杂度
对于数据库应用程序,这是一个相当高的运行时复杂性,因此您可能无法将其直接应用于大型数据库
根据 Wikipedia,可以使用以下方法缓解此限制
- 随机抽样:随机抽样支持大型数据集。通常随机样本适合主存储器。随机抽样需要在准确性和效率之间进行权衡。
- 分区:基本思想是将样本空间划分为 p 个分区。每个分区包含 n/p 个元素。第一次通过对每个分区进行部分聚类,直到对于某个常数 q ≥ 1 的最终聚类数减少到 n/pq。在 n/q 上的第二次聚类通过对分区进行部分聚类。对于第二遍,仅存储代表点,因为合并过程在计算合并群集的代表点之前只需要先前群集的代表点。对输入进行分区可减少执行时间。
- 在磁盘上标记数据:仅给定 k 个集群的代表点,其余数据点也分配给集群。为此,为 k 个聚类中的每一个随机选择一小部分代表点,并将数据点分配给包含最接近它的代表点的聚类。
【讨论】: