【发布时间】:2019-04-01 16:19:03
【问题描述】:
当我增加/减少 SGD 中使用的小批量的批量大小时,我应该改变学习率吗?如果是,那怎么办?
作为参考,我和某人讨论过,据说当batch size增加时,学习率应该有所降低。
我的理解是当我增加批量大小时,计算出的平均梯度会减少噪音,所以我要么保持相同的学习率,要么提高它。
另外,如果我使用自适应学习率优化器,例如 Adam 或 RMSProp,那么我想我可以保持学习率不变。
如果我错了,请纠正我,并就此提供任何见解。
【问题讨论】:
标签: machine-learning deep-learning