【发布时间】:2018-01-30 07:30:38
【问题描述】:
我一直致力于使用 spark 2.2.0 在 scala 中对数据集进行聚类。现在我已经制作了集群,我想测试/评估它的质量。虽然我已经能够找到每个 K 值的误差平方和的集合,但我希望做一个剪影测试。任何人都可以帮助分享任何相关的功能,在scala中这样做的包。
【问题讨论】:
标签: scala apache-spark machine-learning k-means
我一直致力于使用 spark 2.2.0 在 scala 中对数据集进行聚类。现在我已经制作了集群,我想测试/评估它的质量。虽然我已经能够找到每个 K 值的误差平方和的集合,但我希望做一个剪影测试。任何人都可以帮助分享任何相关的功能,在scala中这样做的包。
【问题讨论】:
标签: scala apache-spark machine-learning k-means
Silhouette 不可扩展。它使用成对距离,这总是需要 O(n^2) 时间来计算。
您是否考虑过使用已在 MLlib 中实现的误差平方和 (http://spark.apache.org/docs/latest/ml-clustering.html#k-means),这也有助于确定集群的数量。 (Cluster analysis in R: determine the optimal number of clusters)
【讨论】: