【发布时间】:2016-03-27 13:01:54
【问题描述】:
我正在为 scala 运行来自 here 的 Spark 逻辑回归示例。
在训练部分:
val model = new LogisticRegressionWithLBFGS().setNumClasses(10).run(training)
类数设置为 10。如果我的数据包含 3 个标签,即 5、12 和 20;它引发了一个异常,例如
ERROR DataValidators: Classification labels should be in {0 to 9}. Found 6 invalid labels.
我知道我可以通过将classnum 设置为大于最大类值来解决它。
是否可以在不对标签值进行显式转换的情况下在此类数据集上运行具有真实类数的算法?
如果我以高 classnum 运行它以使其工作,算法是否会预测不存在的类,例如上面的 17?
【问题讨论】:
标签: scala apache-spark logistic-regression