【问题标题】:Spark ML random forest and gradient-boosted trees for regression用于回归的 Spark ML 随机森林和梯度增强树
【发布时间】:2018-09-10 01:44:24
【问题描述】:

根据 Spark ML 文档 random forestgradient-boosted trees 可用于:分类和回归问题:

https://spark.apache.org/docs/latest/ml-classification-regression.html#gradient-boosted-tree-regression

假设我的“标签”从 0..n 中获取整数值,我想训练这些分类器解决回归问题,预测标签字段的连续变量值。但是,我在文档中没有看到如何为这个问题配置这两个回归器,也没有看到任何区分回归与分类案例的类参数。那么这两个分类器应该如何配置回归问题呢?

【问题讨论】:

    标签: apache-spark machine-learning classification regression apache-spark-ml


    【解决方案1】:

    不涉及这样的配置,只是因为回归和分类问题实际上是由 Spark ML 中的不同子模块和类处理的;即对于分类,您应该使用(假设 PySpark):

    from pyspark.ml.classification import GBTClassifier  # GBT
    from pyspark.ml.classification import RandomForestClassifier  # RF
    

    而对于回归,你应该分别使用

    from pyspark.ml.regression import GBTRegressor  # GBT
    from pyspark.ml.regression import RandomForestRegressor  # RF
    

    查看文档中的Classification and regression 概述了解更多详情。

    【讨论】:

      猜你喜欢
      • 2019-10-23
      • 2015-03-07
      • 2018-02-21
      • 1970-01-01
      • 2019-12-06
      • 2016-04-24
      • 2018-12-02
      • 2017-03-01
      • 2020-08-16
      相关资源
      最近更新 更多