【问题标题】:R: border removal for OCRR:OCR 的边框去除
【发布时间】:2017-12-12 15:00:28
【问题描述】:

我正在尝试使用 R 中的 tesserect 包从一些打印表单中提取一些信息。但是,我发现很难处理某些字符超出表单边距的情况。

阅读了一些教程后,似乎删除边框可以改善我的结果。无论如何我可以使用 R 可用的包来做到这一点。我看过包“magick”,它似乎没有检测边界的功能。 最后,如果有其他方法可以解决此问题,请告诉我。 谢谢

【问题讨论】:

    标签: r ocr tesseract


    【解决方案1】:

    是的,你是对的,从图像中移除线条/网格肯定会提高 OCR 的准确性。

    假设图像中只有水平线和垂直线以及打印的文本,这是我的方法,你可以试一试。

    1) 根据图像中存在的线条找到长度高于给定阈值的水平线条。

    2) 求线条粗细

    3) 扫描线条像素,如果线条像素上方和下方没有黑色像素,则将其删除。这一步将避免删除线时删除字符像素。

    4) 垂直线使用相同的 1、2。

    5) 再次扫描垂直线,如果行像素的左右位置没有黑色像素,则删除行像素。

    【讨论】:

      猜你喜欢
      • 2011-09-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-08-15
      • 2013-06-25
      • 1970-01-01
      相关资源
      最近更新 更多