【问题标题】:How to interpret weka classification?如何解读weka分类?
【发布时间】:2011-02-23 15:21:06
【问题描述】:

我们如何使用朴素贝叶斯解释 weka 中的分类结果?

均值、标准差、权重和精度是如何计算的?

kappa统计量、平均绝对误差、均方根误差等是如何计算的?

混淆矩阵的解释是什么?

【问题讨论】:

  • @Atilla Ozgur:读到这个问题属于computer-vision 标签后我感到很困惑,请您详细说明您对该标签的编辑。
  • @Vishrant 问题的原始所有者虽然这个问题应该有计算机视觉,而不是我。我没有更改任何标签。

标签: classification weka


【解决方案1】:

什么是朴素贝叶斯?

explanation 可能有助于阐明朴素贝叶斯的含义;它假设变量的独立性。具体来说,假设我们想预测是否有人走过布鲁克林的展望公园。我们有关于他们是否的数据

a) 住在纽约市

b) 住在城市里

朴素贝叶斯假设这两个变量是独立的。但很明显,如果他们住在纽约市,他们也住在 a 城市。这是一个愚蠢的例子,因为(希望)没有人会使用数据科学来处理这些变量,但它表明了独立性意味着什么。如果a,那么b。另外,如果不是 b,那么就不是 a。

存在依赖,所以朴素贝叶斯的朴素假设不成立。

Wek​​a 教程

This page 可能对新手有用。这对我有很大帮助;它穿过

我不隶属于 Jason Brownlee。他似乎有点销售,但这样做的好处是他保持简单,因为他的目标是初学者

【讨论】:

    【解决方案2】:

    下面是朴素贝叶斯分类器的一些示例输出,使用 10 折交叉验证。那里有很多信息,您应该关注的内容取决于您的应用程序。我将在下面解释一些结果,以帮助您入门。

    === Stratified cross-validation ===
    === Summary ===
    
    Correctly Classified Instances          71               71      %
    Incorrectly Classified Instances        29               29      %
    Kappa statistic                          0.3108
    Mean absolute error                      0.3333
    Root mean squared error                  0.4662
    Relative absolute error                 69.9453 %
    Root relative squared error             95.5466 %
    Total Number of Instances              100     
    
    === Detailed Accuracy By Class ===
    
                   TP Rate   FP Rate   Precision   Recall  F-Measure   ROC Area  Class
                     0.967     0.692      0.686     0.967     0.803      0.709    0
                     0.308     0.033      0.857     0.308     0.453      0.708    1
    Weighted Avg.    0.71      0.435      0.753     0.71      0.666      0.709
    
    === Confusion Matrix ===
    
      a  b   <-- classified as
     59  2 |  a = 0
     27 12 |  b = 1
    

    正确和错误分类的实例显示正确和错误分类的测试实例的百分比。原始数字显示在混淆矩阵中,ab 代表类标签。这里有 100 个实例,所以百分比和原始数字相加,aa + bb = 59 + 12 = 71,ab + ba = 27 + 2 = 29。

    正确分类实例的百分比通常称为准确率或样本准确率。作为性能估计,它有一些缺点(不是机会更正,对类分布不敏感),因此您可能需要查看其他一些数字。 ROC 面积,或 ROC 曲线下的面积,是我的首选度量。

    Kappa 是分类和真实类之间一致性的机会校正度量。它是通过将偶然预期的一致性与观察到的一致性相除并除以最大可能一致性来计算的。大于 0 的值意味着您的分类器做得比机会好(确实应该如此!)。

    错误率用于数值预测而不是分类。在数值预测中,预测不只是对或错,误差有大小,而这些度量反映了这一点。

    希望这能让你开始。

    【讨论】:

    • Kappa 并不是真正的机会校正一致性度量。见thisthis
    【解决方案3】:

    对于某些算法,它给出的每个值都是“50050000”,而对于其他分类器,这些值大约是 49.7、87.4、98.2 等等。

    【讨论】:

    • 能否请您详细说明您的答案,添加更多关于您提供的解决方案的描述?
    【解决方案4】:

    为了详细说明 michaeltwofish 的答案,关于剩余值的一些说明:

    • TP 率:真阳性率(正确分类为给定类的实例)

    • FP 率:误报率(错误归类为给定类的实例)

    • 精确度:真正属于某个类的实例的比例除以归类为该类的实例总数

    • 召回率:归类为给定类的实例的比例除以该类中的实际总数(相当于 TP 率)

    • F-Measure:精度和召回率的组合度量,计算方式为 2 * Precision * Recall / (Precision + Recall)

    关于 ROC 面积测量,我同意 michaeltwofish 的观点,这是 Weka 输出的最重要的值之一。 “最佳”分类器的 ROC 面积值接近 1,0.5 与“随机猜测”相当(类似于 Kappa 统计量为 0)。

    需要注意的是,解释结果时需要考虑数据集的“平衡”。即使分类器不一定特别好,但不成比例的大量实例属于某个类的不平衡数据集可能会导致高准确率。

    进一步阅读:

    【讨论】:

    • 延伸阅读链接绝对有用!
    猜你喜欢
    • 2012-12-13
    • 2017-06-26
    • 2014-04-05
    • 2013-02-19
    • 2012-08-19
    • 2013-04-16
    • 2012-08-12
    • 2023-04-08
    • 2012-04-28
    相关资源
    最近更新 更多