【发布时间】:2016-08-21 16:26:41
【问题描述】:
是否有一些现成的用于 python 或 R 的库或包来减少大型分类因素的级别数?
我想实现与R: "Binning" categorical variables 类似的目标,但将其编码为最常见的 top-k 因素和“其他”。
【问题讨论】:
-
您的意思是将所有“不经常”级别替换为“其他”?
-
是的,这是另一种表达方式,因为否则在使用这些高级分类变量中的几个时,我的数据矩阵会在单热编码的情况下爆炸。
-
查看link
标签: python r encoding categorical-data binning