【问题标题】:Confusion about Precision and Recall in Spam detection垃圾邮件检测中精确率和召回率的混淆
【发布时间】:2013-04-09 17:23:05
【问题描述】:

我正在做一个根据tutorial 检测垃圾邮件帐户的项目。两个标签——“垃圾邮件”和“非垃圾邮件”用于训练和测试。分类已经完成,我要去评估了。

结果是:

*Spam* precision: 0.962917933131
*Spam* recall: 0.6336

*Not spam* precision: 0.72697466468
*Not spam* recall: 0.9756

我已经阅读了精度和召回率的wiki,仍然感到困惑并且不知道如何将其用于测量。

我的目的是减少被标记为“垃圾邮件”普通帐户的数量。一些“垃圾邮件”帐户可以逃脱并不重要。所以我想知道我应该重点改进上面的哪个结果?谢谢。

【问题讨论】:

    标签: machine-learning classification spam precision-recall


    【解决方案1】:

    精确度是归类为阳性的结果中确实是阳性的分数。

    召回率是检测到的所有阳性结果的比例。

    我的目的是减少普通账户的数量 标记为“垃圾邮件”。

    这意味着您希望最大限度地提高垃圾邮件的精度和非垃圾邮件的召回率。您链接到的 wiki 页面解释了您需要知道的所有内容 - 事实上,您的目的是尽量减少“误报”的数量(包括在这两个特征中)。

    建议的关键词:Confusion Matrix

    【讨论】:

      猜你喜欢
      • 2019-10-08
      • 2017-04-05
      • 1970-01-01
      • 1970-01-01
      • 2015-04-17
      • 2022-12-01
      • 2020-08-29
      • 2021-10-07
      • 2016-06-19
      相关资源
      最近更新 更多