【发布时间】:2018-10-02 20:13:09
【问题描述】:
好吧,我一直在阅读一些关于 TensorFlow 中的 AdamOptimizer 的帖子。我认为周围存在一些混淆,至少在像我这样的神经网络初学者中是这样。
如果我理解正确的话,tf.train.AdamOptimizer 会保持所谓的“自适应学习率”。我认为这个学习率会随着时间的增加而变小。
但是,当我绘制学习率缩放的函数时,取自docs,
t <- t + 1
lr_t <- learning_rate * sqrt(1 - beta2^t) / (1 - beta1^t)
这是我得到的:
t = np.arange(200)
result = np.sqrt(1-0.999**t)/(1-0.9**t)
plt.plot(result)
plt.show
所以,对于 t = 1,用户选择的学习率的值乘以 0.3 然后它会快速下降,直到其值的 0.15,然后随着时间的推移逐渐增加,慢慢接近极限 = 用户选择的学习率.
是不是有点奇怪?我想在某个地方我错了,但我希望学习率从较高的值开始,然后逐渐降低到较小的值。
【问题讨论】:
标签: python tensorflow optimization neural-network