先上结论:
1.Nesterov是Momentum的变种。
2.与Momentum唯一区别就是,计算梯度的不同,Nesterov先用当前的速度v更新一遍参数,在用更新的临时参数计算梯度。
3.相当于添加了矫正因子的Momentum。
4.在GD下,Nesterov将误差收敛从O(1/k),改进到O(1/k^2)
5.然而在SGD下,Nesterov并没有任何改进

具体算法如下所示:

Nesterov牛顿动量法

相关文章:

  • 2021-08-20
  • 2021-06-29
  • 2022-02-14
  • 2021-11-04
猜你喜欢
  • 2022-12-23
  • 2021-06-08
  • 2021-06-28
  • 2022-12-23
  • 2021-06-17
  • 2021-06-28
相关资源
相似解决方案