【问题标题】:Tesseract-OCR: need to train all types of samples?Tesseract-OCR:需要训练所有类型的样本?
【发布时间】:2016-02-18 15:12:58
【问题描述】:

我想制作一个可以将打印的名片转换为文本的应用程序。我了解到 tesseract-ocr 可以通过训练提高准确性。

如果我想对每种类型的名片都进行高精度,我需要训练所有类型的名片吗?有数百种具有不同字体或格式的名片。 tesseract-ocr还有其他方法可以实现高精度吗?

【问题讨论】:

    标签: ocr tesseract


    【解决方案1】:

    通常提供的标准英语词典非常强大。在大多数情况下,提高准确性的第一步是预处理。

    Imagemagick 有许多简单的脚本可供您使用。我看到的流行的是http://www.fmwconcepts.com/imagemagick/textcleaner/

    一般你要达到以下几点:

    • 图像阈值
    • 不锐化效果很好
    • 去除噪点(如果图像很好,这可能会被自适应阈值覆盖)
    • 确保 tesseract 白名单适合它正在阅读的领域

    希望对你有帮助

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-06-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-11-05
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多