【问题标题】:Text Detection with YOLO on Challenging Images使用 YOLO 对具有挑战性的图像进行文本检测
【发布时间】:2021-07-17 03:58:23
【问题描述】:

我的图片如下所示:

我的目标是检测和识别号码31197394。我已经对文本识别的深度神经网络进行了微调。如果按照以下格式提供,它可以成功识别正确的号码:

剩下的唯一任务是检测相应的边界框。为此,我尝试了darknet。不幸的是,它没有识别任何东西。有没有人知道在这些图像上表现更好的网络?我知道,亚马逊识别能够解决这个任务。但我需要一个离线工作的解决方案。所以我仍然寄希望于存在有效的预训练网络。非常感谢您的帮助!

【问题讨论】:

  • 97% 对于自制解决方案来说非常令人印象深刻 :) 请问您使用什么进行文本识别?另一个单次检测器还是基于 RNN 的模型?

标签: computer-vision ocr object-detection yolo yolov4


【解决方案1】:

不要说暗网不起作用。这取决于您如何标记数据集。确实,您要识别的数字太小,因此如果您在预处理阶段不对图像进行任何更改,那么神经网络很难很好地识别它们。所以你可以做的肯定会奏效的是:
1---> 标注前,将所有图片的大小增加2倍当前大小(如1000*1000)
2---> 使用这个尺寸 (1000 * 1000) 作为暗网训练器,而不是暗网建议的默认尺寸 416 * 416。然后您必须更改配置文件
3--->使用最新的暗网版本(yolo v4)
4--->在配置文件上,始终保持细分数为1。
我还指出这种方法在内存中过于贪婪,因此需要提供一台 RAM > 16 GB 的机器。优点是好用……

【讨论】:

    【解决方案2】:

    谢谢你们的回答!你是对的,我必须微调 yolo 才能让它工作。所以我创建了一个数据集并微调了 yolov5。我很惊讶结果有多好。尽管总共只有大约 300 张图像,但我预测正确数字的准确率为 97%。这主要是由于强大的增强。确实内存需求很大,但我可以在 32 GM RAM 机器上进行训练。我真的可以鼓励任何面临类似问题的人给 yolo 一个机会!!

    【讨论】:

    • 介意分享使用的预处理是什么?
    • 你的意思是数据增强?基本上,你 yolo 提供的几乎所有东西都是预先构建的,除了镜像和强旋转(在这种情况下没有意义)。
    【解决方案3】:

    也许使用 R-CNN 来识别数字所在的区域,然后将该区域传递给您的微调神经网络进行数字分类

    【讨论】:

      猜你喜欢
      • 2014-07-08
      • 2020-10-01
      • 2016-06-03
      • 2020-02-11
      • 1970-01-01
      • 2018-10-22
      • 2022-12-19
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多