【发布时间】:2020-05-18 14:34:06
【问题描述】:
我认为 Adam 优化器的设计使其能够自动调整学习率。 但是在 Keras 的 Adam 参数选项中有一个选项可以明确提及衰减。 我想澄清衰减对 Keras 中 Adam 优化器的影响。 如果我们在 lr = 0.001 上使用衰减假设 0.01 编译模型,然后拟合运行 50 个 epoch 的模型,那么每个 epoch 之后学习率会降低 0.01 倍吗?
有什么方法可以指定学习率只在运行一定数量的 epoch 后才衰减?
在 pytorch 中有一个名为 AdamW 的不同实现,它在标准 keras 库中不存在。 这和上面提到的在每个 epoch 之后改变衰减是一样的吗?
提前感谢您的回复。
【问题讨论】: