【发布时间】:2014-05-20 08:54:18
【问题描述】:
我在 scala 0.9.0 上运行 k-means 聚类,我试图了解数据如何在 n 个系统之间分布以计算 k 个中心数据点。
我了解什么是 k-means 聚类,但我想知道如何划分数据以及如何在分布式计算(map 和 reduce)上进行计算。在这个 scala 版本中,KMeansDataGenerator 可以选择将数据点生成到 n 个分区中。每个从节点是否得到一个数据文件分区?
【问题讨论】:
标签: k-means apache-spark