【问题标题】:Hadoop distributed version of K-Means?Hadoop分布式版本的K-Means?
【发布时间】:2015-08-10 15:22:56
【问题描述】:

想知道 K-Means 的 Hadoop 分布式版本是否有开源实现?要求使用 Hadoop,因为数据很大,无法容纳在一个盒子中。

提前致谢, 林

【问题讨论】:

标签: hadoop k-means


【解决方案1】:

是的,有,Mahaout 有几个 k-means 实现,例如:mahout.apache.org/users/clustering/k-means-clustering.html

【讨论】:

  • 然而性能太差了,在单个主机上运行快速 k-means 实现几乎总是更快,而不是支付 Mahout 和 Hadoop 的大量开销......(如果您的数据适合主内存,则永远不要使用 Hadoop)
【解决方案2】:

您可以为此使用spark。 Spark 实现了KMeans。 Spark 使用 RDD(弹性分布式数据集)。您的数据分布在您的集群上,每个节点处理最接近的数据。

Spark 的性能可以比 Mahout 更好,因为一些中间过程没有写在 HDFS 上。

【讨论】:

    猜你喜欢
    • 2013-04-22
    • 2014-07-13
    • 2014-05-20
    • 2019-04-06
    • 2017-05-17
    • 2014-05-09
    • 2019-12-18
    • 2016-01-21
    • 1970-01-01
    相关资源
    最近更新 更多