【问题标题】:Training data size for a bayesian classifier贝叶斯分类器的训练数据大小
【发布时间】:2012-02-18 08:02:33
【问题描述】:

我正在使用 apache mahout 在客户支持域中执行情绪分析。由于我无法获得适当的训练数据集,所以我自己制作了。现在我有 100 封正面情绪的支持邮件和 100 封负面情绪的支持邮件。

但问题是,我无法达到准确性。它保持在 55% 左右,这是可悲的。大约 70% 左右的准确度将是令人满意的。另请注意,我使用的是 apache mahout 的免费朴素贝叶斯分类器。

准确地说,是较小的数据集大小降低了准确性吗?如果没有,我应该在哪里调整?

【问题讨论】:

  • 您的训练数据量非常小。这是主要问题。此外,IMO 词干提取通常会降低朴素贝叶斯的准确性。

标签: mahout bayesian sentiment-analysis


【解决方案1】:

为了方便那些将来研究这个问题的人,我将分享我将分类器的准确率从 50% 调整到 78% 左右的方法

  • 对训练和输入数据执行词干提取
  • 对训练和输入数据执行停用词删除
  • 将训练和输入数据转换为小写(或大写)
  • 每个类别的训练数据中的样本数量几乎相等
  • 根据您的域微调 ngram 级别。

这应该会大大提高您的准确性。

【讨论】:

    猜你喜欢
    • 2019-08-08
    • 2015-06-25
    • 2020-09-13
    • 2017-06-21
    • 2023-03-23
    • 2017-08-30
    • 2013-04-11
    • 2011-09-28
    相关资源
    最近更新 更多