【问题标题】:Mahout cpu utilization in clusteringMahout 集群中的 CPU 利用率
【发布时间】:2012-12-29 02:06:51
【问题描述】:

我用 mahout 做文本聚类

我的电脑设备和软件在下面

服务器:
CPU:英特尔至强 E5-2620 2GHz,内存:64GB

软件:
VirtualBox 上的 ubuntu-12.4.1
hadoop-1.0.4,mahout-0.7

我使用树冠算法来聚类 80000 txt。但是运行时间很长,两三个星期就可以跑完,但是我发现CPU利用率只有20%以下。

我发现有人也有这个问题, http://mail-archives.apache.org/mod_mbox/mahout-user/201212.mbox/%3C7959565186420075099@unknownmsgid%3E#archives

但我仍然不知道如何加速它,另一方面,我丢失了一些参数设置吗?还是服务器功能不强,无法运行这个作业?

【问题讨论】:

    标签: hadoop cpu cluster-analysis mahout


    【解决方案1】:

    Hadoop 和 Mahout 适用于多台计算机。在单个主机上,针对此类操作优化的软件可能会快得多。

    Hadoop(和 Mahout)管理太大而无法放入单个计算机内存的数据。这需要将数据存储在文件中并通过网络传输到其他主机。

    现在,如果您采用这种方法 - 重复写入中间结果 - 而无需这样做,您当然会比在内存中执行所有操作要慢。

    由于您的 CPU 未完全使用,您可能会猜到其他地方一定存在瓶颈。看看你的磁盘 IO。这可能是您目前的限制因素。

    【讨论】:

    • 嗨,谢谢您的回复。我检查了一些地方。但仍然没有找到瓶颈。我将在下面列出一些参数设置。
    • 在 Canopy 聚类中,瓶颈通常是距离度量,您使用的是哪一个?
    • 但据我理解,CPU负载
    • 我使用 EuclideanDistanceMeasure t1=300, t2=270,
    • 我在小样本(15000)中尝试了t1=150, t2=100,但结果并不好,经过一些尝试,我设置了t1=300, t2=270。
    猜你喜欢
    • 2018-12-23
    • 1970-01-01
    • 2019-11-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-09-30
    • 1970-01-01
    相关资源
    最近更新 更多