【发布时间】:2016-09-10 15:27:21
【问题描述】:
我注意到,在许多流行的卷积神经网络架构(例如 AlexNet)中,人们使用多个具有几乎相同维度的全连接层来收集对早期层中先前检测到的特征的响应。
我们为什么不只使用一个 FC 呢?为什么这种全连接层的分层排列可能更有用?
【问题讨论】:
-
我认为后期的步骤应该以非线性方式结合前面的步骤。当然,cybenko 定理成立并告诉我们,一个隐藏层就足够了,但是就像深度学习中的任何地方一样,你想用网络深度(更高)换取更好的机会来获得更好的学习层。有很多工作可以解释,为什么这应该更好。一个常见的例子是奇偶函数的学习能力,其中更多的层工作得更好。
-
卷积层提取特征,然后全连接层组合特征以对输出进行建模。但是全连接层的数量越多,神经网络就越复杂和强大,但过拟合的风险也越高。注意:1 个全连接层有 2N 个神经元,与两层有 N 个神经元的模型不同。
标签: image-processing machine-learning computer-vision deep-learning conv-neural-network