【发布时间】:2016-02-18 15:12:58
【问题描述】:
我想制作一个可以将打印的名片转换为文本的应用程序。我了解到 tesseract-ocr 可以通过训练提高准确性。
如果我想对每种类型的名片都进行高精度,我需要训练所有类型的名片吗?有数百种具有不同字体或格式的名片。 tesseract-ocr还有其他方法可以实现高精度吗?
【问题讨论】:
我想制作一个可以将打印的名片转换为文本的应用程序。我了解到 tesseract-ocr 可以通过训练提高准确性。
如果我想对每种类型的名片都进行高精度,我需要训练所有类型的名片吗?有数百种具有不同字体或格式的名片。 tesseract-ocr还有其他方法可以实现高精度吗?
【问题讨论】:
通常提供的标准英语词典非常强大。在大多数情况下,提高准确性的第一步是预处理。
Imagemagick 有许多简单的脚本可供您使用。我看到的流行的是http://www.fmwconcepts.com/imagemagick/textcleaner/
一般你要达到以下几点:
希望对你有帮助
【讨论】: