【发布时间】:2020-07-17 08:40:32
【问题描述】:
来自 Aurelien Geron 的书“使用 Scikit-Learn、Keras 和 Tensorflow 进行机器学习的动手实践”,p。 337:
“作者表明,如果您构建一个仅由密集层堆栈组成的神经网络,并且如果所有隐藏层都使用 SELU 激活函数,那么该网络将自我归一化:在训练过程中,每一层的输出将倾向于保持平均值为 0 和标准差为 1,从而解决了梯度消失/爆炸问题。
我的问题是:为什么它保持 0 的平均值?负值比正值更接近 0,那么为什么输出均值不超过输入均值?
【问题讨论】:
标签: neural-network artificial-intelligence activation-function