【发布时间】:2017-10-16 07:22:11
【问题描述】:
u-net的输入图像大小为572*572,但输出掩码大小为388*388。图像如何被较小的蒙版蒙版?
【问题讨论】:
标签: neural-network deep-learning conv-neural-network kaggle unet
u-net的输入图像大小为572*572,但输出掩码大小为388*388。图像如何被较小的蒙版蒙版?
【问题讨论】:
标签: neural-network deep-learning conv-neural-network kaggle unet
您可能指的是 Ronneberger 等人在其中发布了 U-Net 架构的 scientific paper。该图显示了这些数字。
解释在论文的“3. Training”部分有点隐藏:
由于未填充的卷积,输出图像比输入图像小了一个恒定的边框宽度。
这意味着在每次卷积期间,图像的一部分被“裁剪”,因为卷积将从一个坐标开始,以便它与图层的输入图像/输入块完全重叠。在 3x3 卷积的情况下,这始终是每侧一个像素。有关内核/卷积的更多视觉解释,请参见例如here。 输出较小,因为由于在未填充卷积期间发生裁剪,只有图像的(内部)部分得到结果。
这不是架构的一般特征,而是(未填充的)卷积固有的东西,可以通过填充来避免。可能最常见的策略是在图像边界处镜像,这样每个卷积都可以从图像的最边缘开始(并在其内核重叠的地方看到镜像像素)。然后可以保留输入的大小,对完整的图像进行分割。
【讨论】: