【发布时间】:2019-04-04 22:39:33
【问题描述】:
为什么 Adam 优化器的 Keras 实现有衰减参数,而 Tensorflow 没有?这个论点有什么想法?
【问题讨论】:
标签: tensorflow neural-network keras deep-learning
为什么 Adam 优化器的 Keras 实现有衰减参数,而 Tensorflow 没有?这个论点有什么想法?
【问题讨论】:
标签: tensorflow neural-network keras deep-learning
这些差异可能以某种方式反映了关于学习是否 应用Adam时甚至需要速率衰减。
因此,这些原因说明了为什么存在关于 Adam 学习率衰减是否必要的讨论。
【讨论】:
为什么很难回答。
但是,当您的火车到达极限时,衰减很有趣。 降低学习率可能会以更好的结果改善您的模型。但是机器学习就是测试。
这个想法只是在每次批量更新中降低学习率的值。
这是 Keras 使用的公式:
lr = self.lr
if self.initial_decay > 0:
lr = lr * (1. / (1. + self.decay * K.cast(self.iterations, K.dtype(self.decay))))
基本上是:
lr / (1 + decay*currentBatch) #considering currentBatch keeps incresing, not looping
【讨论】: