【问题标题】:Identifying documents associated with mahout clustering识别与 mahout 聚类相关的文档
【发布时间】:2013-02-05 16:05:34
【问题描述】:

使用 apache mahout 创建文档向量和集群相当容易。执行 clusterdump 允许用户查看与各个集群相关的术语。但是,如何识别属于每个集群的文档?

谢谢

【问题讨论】:

    标签: machine-learning cluster-analysis mahout


    【解决方案1】:

    我认为,对于每个文档,找到它的向量与每个聚类中心的欧几里得距离,并将其分配给最近的聚类。

    【讨论】:

    • 显然取决于聚类算法。 Squared Euclidean 仅适用于普通 k 均值。
    • 谢谢,但是 mahout API 是否提供任何方法/方法集来完成此操作(查找与集群关联的文档)?我刚刚在这篇博文中看到了这个 sn-p,我可能应该试试 bickson.blogspot.com/2011/09/understanding。这将打印每个 doc 及其各自的 cluster 。代码 sn-p 在gist.github.com/anonymous/4998621
    • 这是一个相当容易实现的方法,尤其是 Mahout 不知道。
    猜你喜欢
    • 2011-04-26
    • 2010-12-23
    • 2012-06-11
    • 2013-11-07
    • 1970-01-01
    • 2013-01-10
    • 2023-03-28
    • 1970-01-01
    • 2019-05-08
    相关资源
    最近更新 更多