【发布时间】:2017-11-06 16:09:18
【问题描述】:
我有数千个因素(分类变量),我正在使用朴素贝叶斯进行分类。
我的问题是我的数据集中有很多因素很少出现,因此它们似乎降低了我的预测性能。
确实,我注意到,如果我删除了发生次数很少的分类变量,我的准确性就会显着提高。但理想情况下,我想保留所有因素,您知道这样做的最佳做法是什么吗?
非常感谢。
【问题讨论】:
标签: r naivebayes
我有数千个因素(分类变量),我正在使用朴素贝叶斯进行分类。
我的问题是我的数据集中有很多因素很少出现,因此它们似乎降低了我的预测性能。
确实,我注意到,如果我删除了发生次数很少的分类变量,我的准确性就会显着提高。但理想情况下,我想保留所有因素,您知道这样做的最佳做法是什么吗?
非常感谢。
【问题讨论】:
标签: r naivebayes
评论太长了。
最低频率项可能会对准确性产生不利影响,因为没有足够的数据来做出准确的预测。因此,训练集中的观察结果可能与验证集无关。
您可以将所有频率最低的观测值合并为一个值。副手,我不知道正确的阈值是多少。您可以先将出现 5 次或更少的所有内容放在一起。
【讨论】: