【发布时间】:2020-02-02 18:25:36
【问题描述】:
我有几个类别变量很多的分类变量。我使用 one-hot 编码将它们转换为 1-0 格式。
原文:
column_1 column_2
0.8 X
0.3 C
0.9 D
1.2 C
单热编码:
column_1 column_2_X column_2_C column_2_D
0.8 1 0 0
0.3 0 1 0
0.9 0 0 1
1.2 0 1 0
然后我检查了它们的 feature_importances。
例如 column_2_C 对模型没有重要性,但其他具有相同类别 (A) 的模型具有显着重要性。
在这种情况下或任何其他情况下(%50 个类的重要性很高,其中 %50 个非常低)我该怎么办?如果 column_2_C 具有至关重要的意义,而其他列(X 和 D)根本不重要怎么办?
如果我删除该类会发生什么?这种情况有什么最佳做法吗?
提前致谢,
【问题讨论】:
标签: categorical-data feature-selection dummy-variable