【发布时间】:2017-10-13 14:42:37
【问题描述】:
我正在做一个项目,我必须根据一些训练观察结果创建一个 k-means 模型。我有 380 个观察值(具有 700 个特征)。我正在使用 Spark MlLib 的 K-means 算法。当我选择大于 10 的 k(簇数)时,我的一些簇只得到 1 分(例如在 25 时,其中 6 个只得到 1 分)。首先我认为有些点与其他点的距离很大,但问题是并不总是有相同的点分配给自己的集群。
这是预期的行为吗?如果是一个问题,它有多大?
【问题讨论】:
标签: cluster-computing k-means apache-spark-mllib