【问题标题】:Kmeans clustering using mahout使用 mahout 进行 Kmeans 聚类
【发布时间】:2015-02-05 15:48:20
【问题描述】:

我正在尝试使用 .运行时必须传递的选项需要初始集群的路径。谁能告诉我如何在开始算法之前就拥有初始集群?

bin/mahout kmeans \
    -i <input vectors directory> \
    -c <input clusters directory> \
    -o <output working directory> \
    -k <optional number of initial clusters to sample from input vectors> \
    -dm <DistanceMeasure> \
    -x <maximum number of iterations> \
    -cd <optional convergence delta. Default is 0.5> \
    -ow <overwrite output directory if present>
    -cl <run input vector clustering after computing Canopies>
    -xm <execution method: sequential or mapreduce>

【问题讨论】:

  • Here 是运行综合控制数据的示例。

标签: cluster-analysis mahout k-means


【解决方案1】:

A) Mahout 是 slooooow。如果您的数据适合主内存,请使用其他工具,例如 ELKI。到目前为止,他们对我的表现优于 Mahout。如果您的数据不适合主内存:您确定 k-means 对您的数据有任何意义吗?进行不能解决问题的计算是没有意义的。从一个样本开始,首先检查它是否有效,然后扩大规模。 Mahout 是最后的选择:如果您绝对需要对所有数据进行计算,而其他一切都失败了,那么请使用 Mahout。

B) 阅读所有文档... Mahout k-means 文档中的下一行说:

注意:如果提供了-k 参数,则-c 目录中的所有簇都将被覆盖,-k 随机点将从输入向量中采样成为初始簇中心。

换句话说:如果您知道初始集群中心,请通过-c 提供它们,然后设置-k。否则空的-c 文件夹是可以的,如果您提供-k,则要采样的聚类中心数。

【讨论】:

    猜你喜欢
    • 2013-02-22
    • 1970-01-01
    • 2019-11-27
    • 2019-01-06
    • 2012-06-06
    • 2011-11-03
    • 2012-01-06
    • 2017-11-23
    • 2014-11-01
    相关资源
    最近更新 更多