【发布时间】:2019-07-09 13:59:27
【问题描述】:
问题:在我看来,聚类方法c() 的一个基本属性是我们是否可以通过两个聚类的某个函数f() 组合结果c(A) 和c(B)在某种程度上,我们不必再次应用完整的集群 c(A+B),而是使用 f(c(A),c(B)) 并最终得到相同的结果:
c(A+B) == f(c(A),c(B))
我认为某些c() 拥有这个属性的必要条件是它是确定性,即其内部处理的顺序与结果无关。但是,这可能还不够。
如果有一些参考可以在哪里查找哪些集群方法支持这一点以及在各自情况下好的f() 是什么样的,那将是非常好的。
示例:目前我正在考虑 DBSCAN,如果我允许边界点同时属于多个集群(不连接它们),这应该是确定性的:
- 一个点可以从另一个点到达,如果它在它的 eps-neighborhood 中
- 核心点是至少可以到达 minPts 的点
- 边缘从每个核心点延伸到从它到达的所有点
- 从核心点传入边缘的每个点都与后者在同一个簇中
如果您错过了噪声点,则假设每个核心节点都到达自身(自反性),然后我们将噪声点定义为大小为 1 的集群。边界点是非核心点。之后,如果我们想要一个分区,我们可以将多个集群中的边界点随机分配给其中一个。我认为这与方法本身无关。
【问题讨论】:
标签: merge cluster-analysis dbscan deterministic