【发布时间】:2018-06-01 19:18:45
【问题描述】:
我试图理解为什么 Keras 中的正则化语法看起来是这样的。
粗略地说,正则化是通过在与模型权重的某些函数成比例的损失函数中添加惩罚项来减少过度拟合的方法。因此,我希望将正则化定义为模型损失函数规范的一部分。
然而,在 Keras 中,正则化是在每层的基础上定义的。例如,考虑这个正则化 DNN 模型:
input = Input(name='the_input', shape=(None, input_shape))
x = Dense(units = 250, activation='tanh', name='dense_1', kernel_regularizer=l2, bias_regularizer=l2, activity_regularizer=l2)(x)
x = Dense(units = 28, name='dense_2',kernel_regularizer=l2, bias_regularizer=l2, activity_regularizer=l2)(x)
y_pred = Activation('softmax', name='softmax')(x)
mymodel= Model(inputs=input, outputs=y_pred)
mymodel.compile(optimizer = 'adam', loss = 'categorical_crossentropy', metrics = ['accuracy'])
我原以为不需要 Dense 层中的正则化参数,我可以把最后一行写得更像:
mymodel.compile(optimizer = 'adam', loss = 'categorical_crossentropy', metrics = ['accuracy'], regularization='l2')
这显然是错误的语法,但我希望有人能为我详细说明为什么以这种方式定义正则化以及使用层级正则化时实际发生的情况。
我不明白的另一件事是在什么情况下我会使用三个正则化选项中的每一个或全部:(kernel_regularizer, activity_regularizer, bias_regularizer)?
【问题讨论】:
-
考虑查看here。它可能会给你一些初步的见解。
-
我没有发现上面评论中的链接对这个问题有帮助。