【发布时间】:2016-10-17 00:14:24
【问题描述】:
我对 adam 优化器在 tensorflow 中的实际工作方式感到困惑。
按照我阅读docs 的方式,它说每次梯度下降迭代都会改变学习率。
但是当我调用这个函数时,我会给它一个学习率。而且我不会调用该函数,比如说,做一个时代(隐式调用 # 迭代以完成我的数据训练)。我明确地为每个批次调用函数
for epoch in epochs
for batch in data
sess.run(train_adam_step, feed_dict={eta:1e-3})
所以我的 eta 不能改变。而且我没有传入时间变量。或者这是某种生成器类型的东西,每次我调用优化器时,会话创建时t 都会递增?
假设它是某种生成器类型的东西并且学习率正在无形地降低:我怎样才能在不衰减学习率的情况下运行 adam 优化器?在我看来 RMSProp 基本上是一样的,我唯一要做的就是让它相等(忽略学习率)是改变超参数 momentum 和 decay 以匹配 beta1 和 @分别为 987654328@。对吗?
【问题讨论】:
标签: python tensorflow