【发布时间】:2020-06-14 13:04:29
【问题描述】:
在实现小批量梯度下降时,随机选择训练示例(计算导数)是否更好?还是将整个训练示例洗牌然后遍历它们并每次洗牌会更好吗?第一种方法可能会导致我们跳过全局最小值。
【问题讨论】:
标签: machine-learning deep-learning training-data gradient-descent mini-batch
在实现小批量梯度下降时,随机选择训练示例(计算导数)是否更好?还是将整个训练示例洗牌然后遍历它们并每次洗牌会更好吗?第一种方法可能会导致我们跳过全局最小值。
【问题讨论】:
标签: machine-learning deep-learning training-data gradient-descent mini-batch
对输入数据进行排序意味着模型是在一组不具代表性的输入上进行训练的。你已经改变了分布——可能相当大。
当您使用从整个数据集中随机选择(希望代表)批次的更标准方法时,仍然有可能跳过全局最小值。有许多方法可以帮助减少这种机会。您可能需要查看分级调整以减小步长,例如 simulated annealing。
【讨论】: