【发布时间】:2012-11-05 13:12:54
【问题描述】:
我正在用 Java 编写一个 OCR 程序(使用 Tesseract 从标签生成文本),我希望它能够识别输出中的常见错误,例如 VV 而不是 W 和 NIR 而不是 MR,它们存储在数据库。因此,例如,如果它得到一个像“VVEIN,MIR Adam”这样的字符串,它应该更改为“WEIN,MR Adam”。
检查字符串是否匹配任何常见错误文本的最有效方法是什么?目前我能想到的唯一方法是将字符串传递给每个已知错误的一系列正则表达式,但我希望有一种更有效的方法。谢谢:)
【问题讨论】: