【发布时间】:2018-01-03 09:05:33
【问题描述】:
我正在尝试以更快的 rcnn 了解区域提案网络。我明白它在做什么,但我仍然不明白训练到底是如何工作的,尤其是细节。
假设我们使用 VGG16 的最后一层,形状为 14x14x512(在 maxpool 之前,图像为 228x228)和 k=9 个不同的锚点。在推理时,我想预测 9*2 类标签和 9*4 边界框坐标。我的中间层是一个 512 维向量。 (图片显示来自采埃孚网络的 256)
在他们写的论文中
“我们在图像中随机抽取 256 个锚点来计算损失 小批量的函数,其中采样的正样本和负样本 锚点的比例高达 1:1"
这是我不确定的部分。 这是否意味着对于 9(k) 锚类型中的每一种,特定分类器和回归器都使用仅包含该类型正负锚的小批量进行训练?
这样我基本上可以在中间层训练 k 个具有共享权重的不同网络?因此,每个小批量将由训练数据 x=conv 特征图的 3x3x512 滑动窗口和 y=该特定锚类型的地面实况组成。 在推理时,我将它们放在一起。
感谢您的帮助。
【问题讨论】:
标签: deep-learning object-detection