【发布时间】:2019-03-13 14:17:53
【问题描述】:
我已经阅读了几个YOLO 教程,但我发现如果图像要划分为的每个单元格的锚框是预先确定的,我发现有些难以理解。在我浏览的其中一个指南中,图像被分成 13x13 单元格,并且它声明每个单元格预测 5 个锚框(比它大,好的,这是我的第一个问题,因为它还说它会在预测框之前首先检测小细胞中存在什么物体)。
小单元如何预测比它更大的对象的锚框。也有人说,每个单元格在预测其锚框之前进行分类,如果只有一小部分对象落在单元格内,那么小单元格如何在不查询相邻单元格的情况下对其中的正确对象进行分类
E.g. 说 13 单元格中的一个只包含一个穿着 T 恤的男人的白色口袋部分,该单元格如何正确分类一个男人的存在而不与它的相邻细胞?在尝试定位单个对象时使用普通的 CNN,我知道边界框预测与整个图像有关,所以至少我可以说网络在决定框应该在哪里之前知道图像上各处发生了什么。
PS:我目前认为 YOLO 的工作原理基本上是为每个单元分配预先确定的锚框,在每一端都有一个分类器,然后选择每个类别得分最高的框,但是我敢肯定它不会在某个地方加起来。
更新:在这个问题上犯了一个错误,它应该是关于如何确定常规边界框而不是锚/先前框。所以我将
@craq的答案标记为正确,因为这就是根据 YOLO v2 论文决定锚框的方式
【问题讨论】:
-
见 => also
标签: deep-learning artificial-intelligence object-detection yolo