【发布时间】:2016-01-05 02:10:13
【问题描述】:
我有一组分类列(字符串),我正在对其进行解析并转换为特征向量以传递给 mllib 分类器(随机森林)。
在我的输入数据中,某些列具有空值。比如说,在其中一列中,我有 p 值 + 一个空值: 我应该如何构建我的特征向量和分类器的 categoricalFeaturesInfo 映射?
- 选项 1:我在 categoricalFeaturesInfo 中告诉 p 值,并在输入向量中使用 Double.NaN?
- 附带问题:分类器如何处理 NaN?
- 选项 2:我将空值视为一个值,因此我在 categoricalFeaturesInfo 中告诉 (p+1) 个值,并将空值映射到某个双精度值?
感谢您的帮助。
(PS:我知道新的dataframe + pipeline + vectorindexer API,但由于某些原因它不能很好地满足我的需要,所以我需要自己做)
【问题讨论】:
标签: apache-spark classification random-forest apache-spark-mllib