【问题标题】:Multi class classifier evaluation多类分类器评估
【发布时间】:2017-06-10 06:04:43
【问题描述】:
我正在阅读分类器,尤其是多类分类器。我的问题是,当我使用精度和召回率评估分类器时,我不明白多类分类器评估中 False Positive 和 False Negative 的含义。 p>
例如,当我对文档(其真实类别为 C-1)进行分类时,分类器将其分类为 C-2。那么,我应该在 C-2 处增加假阳性并在 C-1 处增加假阴性吗? (因为真正的答案是 C-1。)
【问题讨论】:
标签:
classification
information-retrieval
confusion-matrix
【解决方案2】:
由于您给出的示例是一个两类问题,我将在您的示例中解释 False Positive 和 False Negative。
在 2 类情况下,混淆矩阵通常如下所示:
| Declare C-1 | Declare C-2 |
|Is C-1| TP | FN |
|Is C-2| FP | TN |
我使用的符号表示以下含义:
- TP = 真阳性(归类为 C-1,实际上是 C-1)
- FN = 假阴性(归类为 C-2 但实际上是 C-1)
- FP = 误报
- TN = 真阴性
根据原始数据,表中的值通常是测试数据中每次出现的计数。由此,我们可以相应地计算精度、召回率和其他值。
例如,您有一个如下表。
| Declare C-1 | Declare C-2 |
|Is C-1| 12 | 6 |
|Is C-2| 8 | 11 |
上表代表以下信息:
- 12 个文档被归类为 C-1,它们实际上属于 C-1。
- 6 个文档被归类为 C-2,但它们实际上属于 C-1。
- 8 个文档被归类为 C-1,但它们实际上属于 C-2。
- 11 个文档被归类为 C-2,它们实际上属于 C-2。
对于 C-1 类:
Precision = 12 / (12 + 8)
Recall = 12 / (12 + 6)
对于 C-2 类:
Precision = 11 / (11 + 6)
Recall = 11 / (11 + 8)
例如,当我对文档进行分类时(其真实类别为 C-1),分类器将其分类为 C-2。那么,我应该在 C-2 处增加假阳性并在 C-1 处增加假阴性吗? (因为真正的答案是 C-1。)
您应该增加与Declare C-2 和Is C-1 关联的混淆矩阵的单元格值的计数,下面用* 表示。
| Declare C-1 | Declare C-2 |
|Is C-1| 0 | 0* |
|Is C-2| 0 | 0 |