【问题标题】:How do CNNs process RGB imagesCNN 如何处理 RGB 图像
【发布时间】:2021-02-10 13:57:06
【问题描述】:

在卷积神经网络中,卷积的过程是丰富的。

众所周知,如果您拍摄 5x5 灰度图像(1 个通道)并将其与 3x3 过滤器(包含某些权重)进行卷积,您会得到一个 3x3 特征图,如下图所示:卷积

但是,一旦您将这种卷积概念扩展到 RGB 图像,现在您有 3 个通道 (R,G,B) 进行卷积,会发生什么?好吧,您只需在过滤器中添加一个与原始图像中的通道数成比例的通道,对吗?假设我们这样做了,与 RGB 进行卷积的过程如下所示:一个 6x6x3 RGB 图像与一个 3x3x3 滤波器卷积。这显然会导致 4x4x1,而不是预期的 4x4x3。

我的问题是为什么会这样?

如果您在互联网上浏览特征图的可视化,它们会返回某种形式的彩色低级和高级特征。这些是内核本身的可视化还是特征图?无论哪种方式,它们都有颜色,这意味着它们必须有超过 1 个通道吗?

【问题讨论】:

    标签: deep-learning neural-network computer-vision conv-neural-network


    【解决方案1】:

    查看 pytorch 的 Conv2d,您会注意到内核的大小不仅受其空间宽度和高度(在您的问题中为 3x3)的影响,还受 输入 的数量的影响频道和输出频道。
    因此,如果您有一个输入 RGB 图像(= 3 个输入通道)和一个大小为 3x3x3 的过滤器(=一个 单个 输出通道,用于 3 个输入通道和空间宽度/高度 = 3),那么您的输出确实是 4x4x1。
    您可以可视化此过滤器,因为您可以将其解释为一个微小的 3x3 RGB 图像。
    可视化网络中更深的特征/过滤器并非易事,您看到的图像通常是旨在“发现”过滤器的优化过程的结果。 this page 概述了一些复杂的特征可视化方法。

    【讨论】:

    • 我听说这个卷积过程的输出引入了一个特征图,它实际上并不保存基于颜色的值,而只是基于你的内核用来卷积的权重。所以我想说的是输出可以简单地使用热图来可视化吗?
    【解决方案2】:

    好吧,根据定义,彩色图像是:3 个通道,您也可以将彩色图像视为 3 个值矩阵的堆栈,因此 2 个红色和蓝色可以设置为零,您还应该检查一下网络的稀缺性...

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-04-23
      • 2019-03-20
      • 1970-01-01
      • 1970-01-01
      • 2019-08-15
      相关资源
      最近更新 更多