【问题标题】:Running mahout k means clustering command without converting input file to vectors运行 mahout k 意味着集群命令而不将输入文件转换为向量
【发布时间】:2013-12-11 23:38:45
【问题描述】:

我有一个数据集(300MB),我希望在其上运行 k 表示使用 Mahout 进行聚类。数据采用 csv 格式,仅包含数值。是否仍然需要为 mahout k 表示命令以矢量化格式输入文件?如果没有,我如何直接在我的 csv 文件上运行 k 表示命令而不将其转换为矢量格式?

【问题讨论】:

    标签: vector cluster-analysis mahout k-means


    【解决方案1】:

    如果您的数据为 300 MB,答案是根本不要使用 Mahout

    真的只有当您的数据不再适合内存时才使用 Mahout。 Map Reduce 是昂贵的,只有当你无法解决问题时才想使用它。

    【讨论】:

    • 这只是一个示例数据,我的实际数据相当大。但问题是我的数据中只有数值。 mahout k 表示仅适用于字符串值,还是我也可以仅对数值成功运行它?有没有人试过这个?请回复
    • K-means 计算 means。它实际上适用于数值数据。你读过关于 k-means 的描述吗?
    • @Anony-Mousse: imiloainf.wordpress.com/2013/07/27/mahout-kmeans-example 告诉 Mahout kmeans 主要用于文本处理,如果需要处理一些数值数据,则需要编写一些实用函数将数值数据写入 sequence-vector格式。
    • @SreeVeni 那又怎样?是的,您可以在 TF-IDF 向量上运行 k-means。但是 Mahout 仍然很烂;它仍然会非常缓慢。
    • @Anony-Mousse:我尝试使用合成数据运行 Kmeans unmeshasreeveni.blogspot.in/2014/11/… 我们如何提供自己的数据来运行 kmeans。有没有相同的教程?
    猜你喜欢
    • 1970-01-01
    • 2021-06-01
    • 2012-03-17
    • 1970-01-01
    • 1970-01-01
    • 2013-12-31
    • 2017-08-28
    • 2012-11-01
    • 2012-11-06
    相关资源
    最近更新 更多