【发布时间】:2017-06-01 04:47:54
【问题描述】:
我有一个 SGD 求解器:
base_lr: 1e-2
lr_policy: "step"
gamma: 0.1
stepsize: 10000
max_iter: 300000
momentum: 0.9
正如 Caffe 文档中的建议,他们说“如果增加 μ,则相应地减少 α 可能是个好主意(反之亦然)”。因此,如果我选择动量是0.99,那么我认为base_lr一定是1e-4
base_lr: 1e-4
lr_policy: "step"
gamma: 0.1
stepsize: 10000
max_iter: 300000
momentum: 0.99
我说的对吗?我也需要增加stepsize 吗?与较小的动量(即0.9)相比,使用较大的动量(即0.99)有什么好处?
【问题讨论】:
-
求解器高度依赖模型拓扑。您正在寻求有关调整未知模型的建议。这会使您的问题过于笼统,无法准确回答。
-
另外,请在交互方面询问。你知道这些超参数(动量、学习率和步长)对训练有什么作用吗?如果没有,请更改您的问题以询问您需要知道的内容。 on topic 和 how to ask 将适用于此。
-
请完成以“then my solver will be”结尾的句子片段。
-
是的,我知道。我的问题只关注对于任何网络的 monentum 0.9 学习率 0.001 和动量 0.99 学习率 0.0001 的情况是否相同?
标签: machine-learning neural-network deep-learning caffe