【发布时间】:2017-04-25 10:19:44
【问题描述】:
如果我有一个基于样本集的混淆矩阵,我如何确定召回/精度/等指标的统计功效(置信区间/区间)?我知道如何对转化概率本身进行统计功效分析,但我该如何对召回率/精度进行分析?
【问题讨论】:
标签: probability confidence-interval confusion-matrix precision-recall
如果我有一个基于样本集的混淆矩阵,我如何确定召回/精度/等指标的统计功效(置信区间/区间)?我知道如何对转化概率本身进行统计功效分析,但我该如何对召回率/精度进行分析?
【问题讨论】:
标签: probability confidence-interval confusion-matrix precision-recall
找到了答案。它是 p +/- Z_score_at_alpha * std_error 的标准置信区间计算的略微修改的方程。唯一的区别是 p(基本上是你的召回概率)是用偏移量计算的 ->adjusted_recall=(TP+2)/(TP+FN+4)。
一般的想法是,当 p 为 0 或 1 时,标准置信区间方程不起作用。这个方程提供了一个允许它起作用的调整。它只是一个软糖因素。
此外,std 错误现在是 sqrt(adjusted_recall(1-adjusted_recall)/(N+4))。 这被称为威尔逊分数区间 - https://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Wilson_score_interval
http://www.stat.ucdavis.edu/~kwwong/STA13-SS1-12/Statistics_13_files/lecture05.pdf
https://stats.stackexchange.com/questions/109429/wilsons-adjustment-for-sample-proportion
【讨论】:
TP+2 放在括号中,以便整个计算介于 0 和 1 之间。此外,我对公式有点困惑。提供的威尔逊区间没有相同的外观。我错过了什么吗?