【发布时间】:2015-08-24 16:45:51
【问题描述】:
我想在 RDD[LabeledPoint] 上训练分类器,仅使用每个 LabeledPoint 中的特征子集(既可以快速调整模型,又可以在每个 LabeledPoint 中包含项目,例如 ID 或评估指标)特征)。我搜索了文档,但找不到指定应包含或忽略哪些列的方法。代码如下,我使用的是 Spark 和 MLLib 1.3.1,Scala 2.10.4。
如果无法排除特定特征,在训练期间忽略的每个数据点中包含一个 ID 仍然会有所帮助。任何帮助表示赞赏!
val numClasses = 2
val categoricalFeaturesInfo = Map[Int, Int](5 -> 2)
val numTrees = 100
val featureSubsetStrategy = "auto"
val impurity = "gini"
val maxDepth = 6
val maxBins = 20
val model = RandomForest.trainClassifier(trainingData, numClasses, categoricalFeaturesInfo, numTrees, featureSubsetStrategy, impurity, maxDepth, maxBins)
【问题讨论】:
标签: apache-spark machine-learning apache-spark-mllib