【发布时间】:2018-03-09 10:19:28
【问题描述】:
我正在使用 Python 学习机器学习,并且了解我无法通过模型运行分类数据,并且必须首先获得假人。我的一些分类数据有空值(只有 2 个特征的一小部分)。当我转换为假人时,看看我是否有缺失值,它总是不显示。我应该事先估算吗?还是我完全估算分类数据?例如,如果类别是男性/女性,我不想用 most_frequent 替换空值。如果该功能是收入,我知道这将如何有意义,并且我将估算缺失值。收入就是收入,而男性不是女性。
那么估算分类数据是否有意义?我走远了吗?很抱歉,这是比实际 Python 编程更多的应用理论,但不确定在哪里发布此类问题。
【问题讨论】:
-
傻瓜正在用 0 和 1 替换分类数据。它还通过特征中不同值的数量来扩大数据集。因此,名为 M/F 的特征将具有“男性”或“女性”值。这在虚拟形式将是 2 列.. 男性和女性,二进制 0 或 1 而不是文本。这个特殊的例子似乎也引入了共线性,因为每次男性为 0,女性为 1,依此类推。
-
所以,您的意思只是将 M/F 映射为 1-hot 编码类型:M -> [0, 1] F-> [1, 0]
标签: python scikit-learn modeling imputation