【问题标题】:naive bayes accuracy increasing as increasing in the alpha value朴素贝叶斯精度随着 alpha 值的增加而增加
【发布时间】:2019-02-18 13:01:33
【问题描述】:

我使用朴素贝叶斯进行文本分类,我有 100k 条记录,其中 88k 是正类记录,12k 条记录是负类记录。我使用 countvectorizer 将句子转换为 unigrams 和 bigrams,并从 [0,10] 中获取 50 个值的 alpha 范围,然后绘制绘图。

在拉普拉斯加性平滑中,如果我不断增加 alpha 值,那么交叉验证数据集的准确度也会增加。我的问题是这种趋势是否可以预料?

【问题讨论】:

  • 同时使用RandomizedSearchCVGridSearchCV 首先使用RandomizedSearchCV,然后使用GridSearchCV。这样alpha 将被更准确地超调。还可以尝试从 1e-4 到 1e3 的各种 alpha 值
  • 是的,我使用了 GridSearchCV,但准确率随着 alpha 的增加而不断增加

标签: machine-learning data-mining cross-validation naivebayes hyperparameters


【解决方案1】:

因为您有 88k 正点和 12K 负点,这意味着您的数据集不平衡。 您可以向平衡数据集添加更多负点,您可以克隆或复制我们称为上采样的负点。在那之后,你的数据集是平衡的,现在你可以应用带有 alpha 的朴素贝叶斯它会正常工作,现在你的模型不是哑模型,之前你的模型是哑的,这就是为什么增加 alpha 它会提高你的准确性。

【讨论】:

    【解决方案2】:

    如果您不断增加 alpha 值,那么朴素贝叶斯模型将偏向具有更多记录的类,并且模型会变成哑模型(欠拟合),因此选择较小的 alpha 值是个好主意。

    【讨论】:

      猜你喜欢
      • 2020-09-09
      • 2019-05-27
      • 2019-04-01
      • 2019-04-14
      • 2012-02-21
      • 2011-12-28
      • 2019-05-04
      • 2016-10-05
      • 2013-09-09
      相关资源
      最近更新 更多