【问题标题】:Spark K-means, points with there own clusterSpark K-means,具有自己集群的点
【发布时间】:2017-10-13 14:42:37
【问题描述】:

我正在做一个项目,我必须根据一些训练观察结果创建一个 k-means 模型。我有 380 个观察值(具有 700 个特征)。我正在使用 Spark MlLib 的 K-means 算法。当我选择大于 10 的 k(簇数)时,我的一些簇只得到 1 分(例如在 25 时,其中 6 个只得到 1 分)。首先我认为有些点与其他点的距离很大,但问题是并不总是有相同的点分配给自己的集群。

这是预期的行为吗?如果是一个问题,它有多大?

【问题讨论】:

    标签: cluster-computing k-means apache-spark-mllib


    【解决方案1】:

    这对于 k-means 来说很典型。

    特别是如果您的特征比数据点多得多,并且如果您有不连续的特征。这是一种过拟合——因为高维,很多点在某种意义上是“唯一的”。

    由于 k-means 涉及随机,您不会每次都得到相同的结果。

    需要探索更高级的算法 - k-means 确实陈旧且有限。 Spark 可能不是最适合您的工具,因为它提供的算法太少了。

    【讨论】:

      猜你喜欢
      • 2016-03-13
      • 2021-04-19
      • 2018-08-14
      • 2012-11-01
      • 2012-11-06
      • 2018-10-04
      • 1970-01-01
      • 2018-09-26
      • 2020-10-24
      相关资源
      最近更新 更多