【问题标题】:Error function and ReLu in a CNNCNN 中的误差函数和 ReLu
【发布时间】:2023-03-26 15:57:01
【问题描述】:

我试图通过自己编写卷积神经网络来更好地理解神经网络。

到目前为止,我将通过不使用最大池和使用简单的 ReLu 激活来使其变得非常简单。我知道这种设置的缺点,但关键不是制造世界上最好的图像检测器。

现在,我一直在理解错误计算的细节,将其传播回去,以及它如何与用于计算新权重的激活函数相互作用。

我阅读了这份文档 (A Beginner's Guide To Understand CNN),但它并不能帮助我理解太多。计算误差的公式已经让我感到困惑。

这个求和函数没有定义起点和终点,所以我基本上看不懂。也许你可以简单地给我一个正确的?

之后,作者假设变量 L 就是“那个值”(我假设他的意思是 E_total?),并举例说明如何定义新的权重:

其中 W 是特定层的权重。

这让我很困惑,因为我一直认为激活函数(在我的例子中是 ReLu)在如何计算新权重中发挥了作用。此外,这似乎意味着我只是对所有层使用错误。难道我传播回下一层的误差值不是取决于我在上一层计算的吗?

也许所有这一切都不完整,您可以为我指明最适合我的情况的方向。

提前致谢。

【问题讨论】:

  • 关于神经网络或其他机器学习算法的理论问题与 Stack Overflow 无关。考虑在Cross Validated 中寻找问题,并可能在此处提出具体问题(仅在此处询问指针可能与此处一样开放)。

标签: neural-network conv-neural-network backpropagation


【解决方案1】:

你不会反向传播错误,而是梯度。激活函数在计算新权重中起作用,这取决于所讨论的权重是在所述激活之前还是之后,以及它是否连接。如果权重w 在非线性层f 之后,那么梯度dL/dw 将不依赖于f。但是如果wf 之前,那么,如果它们是连接的,那么dL/dw 将依赖于f。例如,假设w 是全连接层的权重向量,并假设f 直接跟在该层之后。那么,

dL/dw=(dL/df)*df/dw  //notations might change according to the shape 
                     //of the tensors/matrices/vectors you chose, but 
                     //this is just the chain rule

至于您的成本函数,它是正确的。许多人以这种非正式的风格编写这些公式,以便您了解这个想法,但您可以将其调整为您自己的张量形状。顺便说一句,这种 MSE 函数更适合连续标签空间。您可能想使用 softmax 或 svm loss 进行图像分类(我会回到那个)。无论如何,当您为此功能要求正确的形式时,这里有一个示例。想象一下,你有一个神经网络可以预测某种矢量场(如表面法线)。假设它需要一个 2d 像素 x_i 并为该像素预测一个 3d 向量 v_i。现在,在您的训练数据中,x_i 已经有一个地面实况 3d 向量(i.e 标签),我们将其称为y_i。然后,您的成本函数将是(我在所有数据样本上运行的索引):

sum_i{(y_i-v_i)^t (y_i-vi)}=sum_i{||y_i-v_i||^2}

但正如我所说,如果标签形成连续空间(此处为 R^3),则此成本函数有效。这也称为回归问题。

如果您对(图像)分类感兴趣,这里有一个示例。我将用 softmax 损失来解释它,其他损失的直觉或多或少相似。假设我们有n 类,并想象在您的训练集中,对于每个数据点x_i,您有一个标签c_i,表示正确的类。现在,您的神经网络应该为每个可能的标签生成分数,我们将注意到 s_1,..,s_n。让我们将训练样本x_i 的正确类别的分数记为s_{c_i}。现在,如果我们使用 softmax 函数,直觉是将分数转换为概率分布,并最大化正确类别的概率。也就是说,我们最大化函数

sum_i { exp(s_{c_i}) / sum_j(exp(s_j))}

i 在所有训练样本上运行,j=1,..n 在所有类别标签上运行。

最后,我认为您正在阅读的指南不是一个好的起点。我推荐this 优秀的课程代替(本质上至少是 Andrew Karpathy 部分)。

【讨论】:

    猜你喜欢
    • 2015-02-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-05-19
    • 1970-01-01
    • 1970-01-01
    • 2021-08-31
    • 2019-11-16
    相关资源
    最近更新 更多