【发布时间】:2012-08-08 09:53:21
【问题描述】:
我有六个输入、一个隐藏层和两个输出节点 (1; 0) 的前馈神经网络。该 NN 通过 0;1 值学习。 应用模型时,创建了变量confidence(0)和confidence(1),其中每行这两个数字的总和为1。 我的问题是:这两个数字(置信度(0)和置信度(1))究竟是什么意思?这两个数字是概率吗?
感谢解答
【问题讨论】:
我有六个输入、一个隐藏层和两个输出节点 (1; 0) 的前馈神经网络。该 NN 通过 0;1 值学习。 应用模型时,创建了变量confidence(0)和confidence(1),其中每行这两个数字的总和为1。 我的问题是:这两个数字(置信度(0)和置信度(1))究竟是什么意思?这两个数字是概率吗?
感谢解答
【问题讨论】:
一般情况
置信度值(或分数,因为它们在其他程序中被称为)代表了一个衡量标准,即模型对所呈现的示例属于某个类别的信心程度。它们高度依赖于一般策略和算法的属性。
示例
最简单的例子是多数分类器,它只是根据原始测试集中的比例为所有观察分配相同的分数
另一个例子是 k-nearest-neighbor-classifier,其中类 i 的分数是通过平均到那些都属于 k-nearest-neighbors 并且具有第一类。然后对所有类别的分数进行归一化。
在NN的具体例子中,不查代码不知道是怎么计算出来的。我猜这只是输出节点的值,在两个类之间进行了归一化。
置信度是否代表概率?
一般不会。为了说明这种情况下的概率意味着什么:如果一个示例对于类别“1”的概率为 0.3,那么具有 相似特征/变量值的所有示例中的 30% 应该属于类别“1”和 70%不应该。
据我所知,他的任务叫做“校准”。为此,存在一些通用方法(例如,对分数进行分箱并将它们映射到相应箱的类别分数)和一些依赖于分类器的方法(例如,为 SVM 发明的Platt Scaling)。一个好的开始是:
【讨论】:
置信度度量对应于初始训练数据集中激活的输出 0 和 1 的比例。
例如如果您的训练集 30% 有输出 (1;0),其余 70% 有输出 (0; 1),则 confidence(0) = 30% and confidence(1) = 70%
【讨论】: