【发布时间】:2018-08-16 17:33:57
【问题描述】:
我一直在关注斯坦福的 cs231n 讲座,并尝试自己完成作业,并在 github 和我的博客上分享这些解决方案。但是我很难理解如何对反向传播进行建模。我的意思是我可以编写模块化的前向和后向传递,但让我困扰的是,如果我有以下模型:Two Layered Neural Network
让我们假设这里的损失函数是一个 softmax 损失函数。在我的模块化 softmax_loss() 函数中,我正在计算关于分数的损失和梯度(dSoft = dL/dY)。之后,当我向后跟踪时,假设 b2,db2 将等于 dSoft*1 或 dW2 将等于 dSoft*dX2(relu 门的输出)。这里的链式法则是什么?为什么 dSoft 不等于 1 ?因为 dL/dL 将是 1 ?
【问题讨论】:
标签: deep-learning backpropagation