【问题标题】:How to speed up training Word2vec model with spark?如何使用 spark 加快训练 Word2vec 模型?
【发布时间】:2019-08-12 11:07:58
【问题描述】:

我正在使用 spark Word2vec API 来构建词向量。代码:

val w2v = new Word2Vec()
            .setInputCol("words")
            .setOutputCol("features")
            .setMinCount(5)

但是,这个过程太慢了。我检查了火花监视器网站,有两个工作要运行很长时间。

我的电脑环境有24核CPU和100G内存,如何高效使用?

【问题讨论】:

    标签: apache-spark apache-spark-mllib


    【解决方案1】:

    我会尝试增加您正在对其进行特征提取的数据框中的分区数量。落后者可能是由于数据偏差导致大部分数据由一个节点或核心处理。如果可能,通过逻辑分区分配数据,如果没有,则创建随机均匀分布。

    【讨论】:

      猜你喜欢
      • 2018-01-11
      • 1970-01-01
      • 2021-03-31
      • 2015-04-02
      • 2016-03-26
      • 2017-09-01
      • 2021-12-15
      • 2023-03-17
      • 1970-01-01
      相关资源
      最近更新 更多