【问题标题】:Evaluating the model in WEKA在 WEKA 中评估模型
【发布时间】:2016-06-27 16:49:34
【问题描述】:

我在数据集上应用了分类算法并得出以下统计数据:

Correctly Classified Instances         684               76.1693 %
Incorrectly Classified Instances       214               23.8307 %
Kappa statistic                          0     
Mean absolute error                      0.1343
Root mean squared error                  0.2582
Relative absolute error                100      %
Root relative squared error            100      %
Total Number of Instances              898     

=== Detailed Accuracy By Class ===

               TP Rate   FP Rate   Precision   Recall  F-Measure   ROC Area  Class
                 0         0          0         0         0          0.5      1
                 0         0          0         0         0          0.5      2
                 1         1          0.762     1         0.865      0.5      3
                 0         0          0         0         0          ?        4
                 0         0          0         0         0          0.5      5
                 0         0          0         0         0          0.5      U
Weighted Avg.    0.762     0.762      0.58      0.762     0.659      0.5  

=== Confusion Matrix ===

   a   b   c   d   e   f   <-- classified as
   0   0   8   0   0   0 |   a = 1
   0   0  99   0   0   0 |   b = 2
   0   0 684   0   0   0 |   c = 3
   0   0   0   0   0   0 |   d = 4
   0   0  67   0   0   0 |   e = 5
   0   0  40   0   0   0 |   f = U

我可以理解大部分数据,但是由于我是 Weka 的新手,因此在解释这些值时存在问题: 1. 总体报告的错误率是多少? 2. 如果模型有什么有趣的地方,如何解释?

【问题讨论】:

  • 您的 ML 模型似乎无法学习任何东西,只能预测所有 c 类的测试实例。

标签: performance machine-learning classification weka


【解决方案1】:

ROC 区域在评估准确性和解释模型的有趣程度方面也很有用。简而言之,将真阳性率与假阳性率作图,ROC 面积计算为该曲线下方的面积。较高的 ROC 区域(例如 0.9 到 1)表明该模型非常擅长对实例进行分类,而 ROC 区域为 0.5(如您的模型中所示)意味着该模型在分类方面并不比抛硬币等随机方法更好。

【讨论】:

    【解决方案2】:

    1) 总体误差测量

    PrecisionRecallF-Measure 三元组经常一起报告,因为每个数字代表模型的不同方面。

    如果只想有一个数字,则采用 Percent (In)correctly Classified InstancesWeighted Avg。 F 测量

    其他错误度量也很有用,但它们需要更深入的统计知识(我缺乏:-)

    2) 模型的一些有趣之处

    Detailed Accuracy By ClassConfusion Matrix 你可以看到模型非常简单。它将所有内容归为第 3 类。错误度量看起来相当成功,但这仅仅是因为数据集中 76% 的实例属于类 3。该模型对应于常用的基线算法,称为“最常见的类”。

    【讨论】:

      猜你喜欢
      • 2013-03-24
      • 2015-02-05
      • 2016-08-22
      • 2019-05-01
      • 2017-03-24
      • 2020-03-06
      • 2017-04-24
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多