【发布时间】:2019-07-28 07:43:02
【问题描述】:
我正在训练一个模型。为了克服过度拟合,我已经完成了优化、数据增强等。我有一个更新的 LR(我尝试了 SGD 和 Adam),当有一个平台时(也尝试了一步),学习率降低了一个因子,直到它达到 LR 1e-08 但不会低于该值,并且我的模型的验证在此之后卡住了。我尝试将 epsilon 参数传递给 Adam 以建议一个较小的值,但它仍然停留在 LR 1e-08。我也通过了体重衰减,但这并没有改变这种情况。也没有将 amsgrad 设置为 true。
我做了一些研究,人们认为 Adam 优化器存在固有问题,但没有提到学习率 - 每个讨论都补充说,使用 SGD,没有问题。
这是为什么?它是一个错误还是设计如此,因为作者认为在那之后它是一个毫无意义的小值?似乎为我的数据集设置一个较小的学习率确实会有所帮助,因为在学习率降至 LR 1e-08 之前一切似乎都很好。
【问题讨论】:
标签: optimization deep-learning pytorch gradient-descent