【发布时间】:2018-08-18 04:15:30
【问题描述】:
我正在尝试创建 Faster RCNN 之类的模型。当涉及到来自特征图的 ROI 池时,我陷入了困境。我知道这里可以使用双线性采样,但它可能对端到端训练没有帮助。如何在tensorflow中实现这个ROI pooling layer?
【问题讨论】:
标签: python tensorflow neural-network artificial-intelligence
我正在尝试创建 Faster RCNN 之类的模型。当涉及到来自特征图的 ROI 池时,我陷入了困境。我知道这里可以使用双线性采样,但它可能对端到端训练没有帮助。如何在tensorflow中实现这个ROI pooling layer?
【问题讨论】:
标签: python tensorflow neural-network artificial-intelligence
双线性采样——顾名思义——实际上甚至可以用于端到端训练,因为它基本上是一种线性操作。但是,缺点是您的局部最大值(即强激发或某些单位)可能会消失,因为您的采样点恰好接近最小值。为了解决这个问题,您可以改为应用 max_pool(features, kernel, stride) 操作,调整内核和步幅,以使该最大池操作的最终输出始终具有相同的尺寸。
一个例子:你的特征大小为12x12,你想合并到4x4,然后设置kernel=(3,3)和stride=(3,3)将帮助你实现这一点,对于每个3x3补丁,最强的激发相应的特征图将包含在输出中。
【讨论】: