【问题标题】:What does the coordinate output of yolo algorithm represent?yolo算法的坐标输出代表什么?
【发布时间】:2018-09-22 09:41:50
【问题描述】:

我的问题与此主题类似。当我开始思考 yolo 算法的输出时,我正在观看 Andrew Ng 的关于边界框预测的讲座。让我们考虑这个例子,我们使用 19x19 的网格和只有一个具有 2 个类的感受野,所以我们的输出将是 => 19x19x1x5。最后一维(大小为 5 的数组)表示如下:

1) The class (0 or 1)  
2) X-coordinate  
3) Y-coordinate  
4) height of the bounding box  
5) Width of the bounding box

我不明白 X,Y 坐标是代表整个图像大小的边界框,还是仅仅代表感受野(过滤器)。在视频中,边界框被表示为感受野的一部分,但逻辑上感受野比边界框小得多,而且人们可能会修改过滤器的大小,因此相对于过滤器定位边界框是没有意义的。

那么,基本上图像边界框的坐标代表什么?

【问题讨论】:

    标签: machine-learning deep-learning computer-vision conv-neural-network yolo


    【解决方案1】:

    来自Understanding YOLO 发帖@Hacker Noon:

    每个网格单元预测 B 个边界框以及 C 类 概率。边界框预测有 5 个分量:(x, y, w, h,信心)(x, y) 坐标代表中心 框,相对于网格单元位置(请记住,如果中心 盒子的落在网格单元格内,而不是这个单元格 负责)。这些坐标被归一化为介于 0 和 1。(w, h) 框尺寸也归一化为 [0, 1], 相对于图像大小。我们来看一个例子:

    【讨论】:

    • 那么说该算法将图像检测视为回归问题是否正确?
    • @AyushChaurasia 确实,对象检测涉及分类回归...
    • 在很多博客中他们都使用了wrt full image,我相信wrt grid效果更好
    • @desertnaut 是否将它们归一化为 0-1,以便可以在输出层使用 sigmoid?
    猜你喜欢
    • 2021-01-21
    • 2022-08-20
    • 2020-09-01
    • 2012-05-10
    • 1970-01-01
    • 2021-08-01
    • 1970-01-01
    • 2017-01-07
    • 1970-01-01
    相关资源
    最近更新 更多