【发布时间】:2021-03-15 09:38:37
【问题描述】:
所以我使用一些数据来制作随机森林模型。有多个分类列,我使用 sklearn LabelEncoder 将它们更改为数字。例如 'male' 和 'female' 的标签分别为 '0' 和 '1'。然后我使用模型来预测单个数据。在预测数据之前,我还将分类更改为数值。然后我意识到即使分类数据不同,单个数据的标签也总是相同的。例如(单个数据),男性和女性被标记为'0',其他也相同。这使我的模型无法使用。我应该只是制作标签手册还是有一些想法?
部分代码
label = LabelEncoder()
train_data['gender'] = label.fit_transform(train_data['gender'])
train_data['ever_married'] = label.fit_transform(train_data['ever_married'])
train_data['work_type'] = label.fit_transform(train_data['work_type'])
train_data['Residence_type'] = label.fit_transform(train_data['Residence_type'])
train_data['smoking_status'] = label.fit_transform(train_data['smoking_status'])
【问题讨论】:
-
以这种方式使用 labelencoder 将导致数字具有多种含义,即 0 可以表示“男性”,也可以表示“已婚”等,
标签: python machine-learning scikit-learn random-forest