【发布时间】:2020-01-05 05:09:14
【问题描述】:
我正在研究一个数据集,该数据集的特征是单个示例具有多个类别。 该功能如下所示:-
Feature
0 [Category1, Category2, Category2, Category4, Category5]
1 [Category11, Category20, Category133]
2 [Category2, Category9]
3 [Category1000, Category1200, Category2000]
4 [Category12]
问题与贴出的这个问题类似:-Encode categorical features with multiple categories per example - sklearn
现在,我想对这个特征进行矢量化。一种解决方案是按照上述类似问题的答案中的建议使用MultiLabelBinarizer。但是,大约有 2000 个类别,这导致了稀疏且非常高维的编码数据。
还有其他可以使用的编码吗?或者这个问题的任何可能的解决方案。谢谢。
【问题讨论】:
标签: machine-learning scikit-learn feature-extraction categorical-data