【问题标题】:Low Frequency Terms - Naive Bayes Improving Accuracy低频项 - 朴素贝叶斯提高准确性
【发布时间】:2017-11-06 16:09:18
【问题描述】:

我有数千个因素(分类变量),我正在使用朴素贝叶斯进行分类。

我的问题是我的数据集中有很多因素很少出现,因此它们似乎降低了我的预测性能。

确实,我注意到,如果我删除了发生次数很少的分类变量,我的准确性就会显着提高。但理想情况下,我想保留所有因素,您知道这样做的最佳做法是什么吗?

非常感谢。

【问题讨论】:

    标签: r naivebayes


    【解决方案1】:

    评论太长了。

    最低频率项可能会对准确性产生不利影响,因为没有足够的数据来做出准确的预测。因此,训练集中的观察结果可能与验证集无关。

    您可以将所有频率最低的观测值合并为一个值。副手,我不知道正确的阈值是多少。您可以先将出现 5 次或更少的所有内容放在一起。

    【讨论】:

    • 嗨,戈登,感谢您的回复。这就是我所做的,通过删除出现少于 50 次的任何术语(对于出现超过 400 次的最高频率术语)。通过这样做,我的准确率达到了 80%。但我的问题是我还需要包括我认为的小术语。如果我这样做,它会下降到 20/30% 的准确度,这是不值得的......
    • @ML_Enthousiast 。 . . 50 的阈值可能太高了。结果的大幅下降表明稀有术语之间存在相关性。 80% 可能还不错。
    • 但是在这种情况下,如果我想保留所有条款,即使是那些不经常出现的条款,最佳做法是什么?
    猜你喜欢
    • 2017-12-21
    • 2018-01-13
    • 2017-03-24
    • 1970-01-01
    • 2017-11-05
    • 2012-07-31
    • 2016-08-12
    • 2017-11-18
    • 2020-01-13
    相关资源
    最近更新 更多