【发布时间】:2017-12-27 00:23:19
【问题描述】:
我有一个数据集,其中 (500+) 列之间存在高度相关性。据我了解(如果我错了,请纠正我),您使用零均值和标准偏差 1 进行归一化的原因之一是,具有给定学习率的优化器更容易处理许多问题,而不是采用 X 规模的学习率。
同样,为什么我应该“白化”我的数据集也是有原因的。这似乎是图像处理中的一个常见步骤。如果列是独立的,它会以某种方式使优化器更容易吗?
我知道,人们过去常常对矩阵进行去相关处理,以使权重在统计上变得更显着,并使矩阵求逆更稳定。至少在涉及到 DL 时,矩阵求逆部分似乎不存在,因为我们现在使用随机梯度下降 (SGD) 的变体。
【问题讨论】:
标签: deep-learning