【发布时间】:2020-04-21 01:42:32
【问题描述】:
我想从身份证图像中提取特定类型的文本:
如您所见,它们具有各种照明和清晰度条件。最终目标是识别黑色文本。如果它们分离得很好,我已经设法用 Tesseract OCR 做得很好(顺便说一下,这是 VIE 语言,以防你想用 Tesseract 自己尝试一下)。但是,在上面的例子中,黑色文本和蓝色文本重叠,这让 Tesseract 感到困惑。所以我目前的目标是干净地移除它们,同时不会严重扭曲黑色模糊像素,以便 Tesseract 仍然有效。
最可靠的方法是什么? (如果可能,将不胜感激 Python 中的代码示例。)
【问题讨论】:
-
最可靠的方法是获取正确的图像。其他任何事情都是猜测工作。如果您想阅读身份证上的文字,请将它们以可重复的方式呈现给您的相机,例如放在玻璃板上。
标签: opencv image-processing ocr