【问题标题】:Why could u-net mask image with smaller mask?为什么 u-net 可以用较小的掩码掩码图像?
【发布时间】:2017-10-16 07:22:11
【问题描述】:

u-net的输入图像大小为572*572,但输出掩码大小为388*388。图像如何被较小的蒙版蒙版?

【问题讨论】:

    标签: neural-network deep-learning conv-neural-network kaggle unet


    【解决方案1】:

    您可能指的是 Ronneberger 等人在其中发布了 U-Net 架构的 scientific paper。该图显示了这些数字。

    解释在论文的“3. Training”部分有点隐藏:

    由于未填充的卷积,输出图像比输入图像小了一个恒定的边框宽度。

    这意味着在每次卷积期间,图像的一部分被“裁剪”,因为卷积将从一个坐标开始,以便它与图层的输入图像/输入块完全重叠。在 3x3 卷积的情况下,这始终是每侧一个像素。有关内核/卷积的更多视觉解释,请参见例如here输出较小,因为由于在未填充卷积期间发生裁剪,只有图像的(内部)部分得到结果。

    这不是架构的一般特征,而是(未填充的)卷积固有的东西,可以通过填充来避免。可能最常见的策略是在图像边界处镜像,这样每个卷积都可以从图像的最边缘开始(并在其内核重叠的地方看到镜像像素)。然后可以保留输入的大小,对完整的图像进行分割。

    【讨论】:

    • 那么在原论文中描述的U-Net架构之后有没有后处理阶段呢?由于输出的形状为 (388,388,2),因此需要一些映射到原始 512x512 形状,对吧?
    • 是和否:如上所述,较小的形状是由于裁剪。对原始形状的唯一明智的后处理/映射是将原始图像裁剪为输出大小(只有图像中心部分的分割预测)。如前所述:您可以使用填充卷积来避免这种情况(并获得完整的 512x512 预测)。常见的 NN 实现(Caffe、Tensorflow 等)开箱即用。
    • 非常感谢您的回答。他没有提到他试图只预测纸上图像的中心部分,这不是很奇怪吗?还是我错过了?
    • 是的,当我第一次阅读它时,我也感到困惑。但是在许多论文中,不同的知识是先决条件,并且假定为给定的,因此缺少解释。 Ronneberger 显然假设他给定的信息足以得出这样一个事实,即他只裁剪/预测中心部分。
    • 与“正常”卷积相比,(零)填充卷积有什么缺点吗?换句话说:我应该根据科学论文构建我的 unet 模型,还是可以使用零填充转换。后者用于我在 github 上找到的许多实现中。
    猜你喜欢
    • 2018-07-28
    • 2021-04-08
    • 2020-06-14
    • 2020-04-13
    • 2021-06-24
    • 1970-01-01
    • 1970-01-01
    • 2011-08-01
    • 2018-07-21
    相关资源
    最近更新 更多