【问题标题】:OCR image preprocessing with ImageMagick使用 ImageMagick 进行 OCR 图像预处理
【发布时间】:2019-06-04 09:39:22
【问题描述】:

我正在尝试在将图像发送到 tesseract 之前找到使用 ImageMagick 清理图像的最佳方法。

目前为止最好的结果是这个组合给出的

convert test.tif -fill black -fuzz 30% +opaque "#FFFFFF" result.tif

这是结果图片

它看起来不错,但我需要它变得更好,因为 tesseract 仍然不能产生最好的结果。

我该如何改进它?

这就是我正在处理的图像的外观。 [2] [3]

这是原始 tif 图片。 https://www.dropbox.com/sh/jyrd58nbrava3j7/AAASaWBXYUk39oTJtAx4RRQRa?dl=0[!

【问题讨论】:

  • 对我来说效果很好,我得到了238, Y= 514
  • 您使用哪个版本的 tesseract? 3 还是 4?
  • 我正在使用 3,但会尝试 4,因为它使用深度学习。
  • 我该如何改进它?”可能通过降低颜色深度(1 位单色)来代替。

标签: image-processing imagemagick ocr tesseract imagemagick-convert


【解决方案1】:

转换 test.tif -negate -t​​hreshold 100 -negate result.tif

根据您的需要将阈值更改为高 my results was this on 100 或低。希望对你有帮助

【讨论】:

    猜你喜欢
    • 2014-03-30
    • 2015-05-10
    • 2016-03-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-17
    • 1970-01-01
    • 2020-12-29
    相关资源
    最近更新 更多