【发布时间】:2017-03-19 07:34:57
【问题描述】:
我有一个 Java 应用程序,它在具有 200K 样本的训练集上训练 MLlib 随机森林 (org.apache.spark.mllib.tree.RandomForest)。我注意到在训练期间只使用了一个 CPU 内核。鉴于随机森林是 N 个决策树的集合,人们会认为这些树可以并行训练,从而利用所有可用的核心。是否有配置选项或 API 调用或其他任何可以启用决策树并行训练的方法?
【问题讨论】:
-
如果您只看到一个活动线程,那是您的代码或配置,而不是
org.apache.spark.mllib.tree.RandomForest -
@LostInOverflow 维基答案?
-
@eliasah 让我们给 Morten Jorgensen 时间来更新这个问题。
标签: java apache-spark machine-learning random-forest apache-spark-mllib