【发布时间】:2021-05-08 03:25:41
【问题描述】:
在反向传播中,是使用梯度 w.r.t 计算的 Loss w.r.t layer L 的梯度。 L-1 层?或者,是损失 w.r.t 的梯度。使用梯度 w.r.t 层 L 计算的层 L-1?
【问题讨论】:
标签: deep-learning neural-network gradient-descent
在反向传播中,是使用梯度 w.r.t 计算的 Loss w.r.t layer L 的梯度。 L-1 层?或者,是损失 w.r.t 的梯度。使用梯度 w.r.t 层 L 计算的层 L-1?
【问题讨论】:
标签: deep-learning neural-network gradient-descent
在反向传播中使用梯度下降函数来找到调整权重的最佳值。有两种常见的梯度下降类型:Gradient Descent 和 Stochastic Gradient Descent。
梯度下降是一个函数,它决定了改变权重的最佳调整值。在每次迭代中,它决定了权重应该调整的体积/数量,离最佳确定的权重越远,调整值越大。你可以把它想象成一个滚下山坡的球;球的速度是调整值,山是可能的调整值。本质上,您希望球(调整值)尽可能接近世界底部(可能的调整)。球的速度会增加,直到它到达山脚 - 山脚是最好的值。 更实用的解释可以在here找到。
随机梯度下降是梯度下降函数的更复杂版本,它用于可能具有错误最佳调整值的神经网络,其中常规梯度下降不会找到最佳值,而是找到最佳值认为是最好的。这可以类比为球滚下两座山丘,山丘的高度不同。它滚下第一座山丘,到达第一座山丘的底部,以为它已经达到了可能的最佳答案,但是通过随机梯度下降,它会知道它现在所处的位置不是最佳位置,但实际上,第二座山的底部。
左边是梯度下降的输出。 右边是随机梯度下降会找到的(最好的可能值)。 可以在here 找到该解释的更具描述性和实用性的版本。
最后总结一下我对你的问题的回答,在反向传播中,你计算最右边的权重矩阵的梯度,然后相应地调整权重,然后向左移动一层,L-1,(在下一个weight-matrix) 并重复该步骤,换句话说,您确定梯度,进行相应调整,然后向左移动。
这个问题我在另一个问题里也有详细讲过,可能对check that one out有帮助。
【讨论】:
How do you calculate Gradient of Loss?
L-1)。我会在我的答案中包含这个
总之,
从左层到右层
的前馈工作从右层到左层的反向传播可以更新所有层的权重和偏差,从而将成本降至最低。在每次迭代中,我们计算损失并更新权重和偏差。
【讨论】:
L wrt layer l−1的梯度是使用梯度wrt layer l计算的
【讨论】: