【问题标题】:Segmenting text from images从图像中分割文本
【发布时间】:2020-04-21 01:42:32
【问题描述】:

我想从身份证图像中提取特定类型的文本:

如您所见,它们具有各种照明和清晰度条件。最终目标是识别黑色文本。如果它们分离得很好,我已经设法用 Tesseract OCR 做得很好(顺便说一下,这是 VIE 语言,以防你想用 Tesseract 自己尝试一下)。但是,在上面的例子中,黑色文本和蓝色文本重叠,这让 Tesseract 感到困惑。所以我目前的目标是干净地移除它们,同时不会严重扭曲黑色模糊像素,以便 Tesseract 仍然有效。

最可靠的方法是什么? (如果可能,将不胜感激 Python 中的代码示例。)

【问题讨论】:

  • 最可靠的方法是获取正确的图像。其他任何事情都是猜测工作。如果您想阅读身份证上的文字,请将它们以可重复的方式呈现给您的相机,例如放在玻璃板上。

标签: opencv image-processing ocr


【解决方案1】:

您可以尝试使用颜色进行图像分割。如果某个像素的颜色在接近 (0, 0, 0) 的 RGB 区域内,则该像素很可能成为相关黑色文本的一部分。

另一种方法是检查每个像素的Chrominance 分量。假设黑色文本具有较低的色度,这是图片的相关部分。

我们的想法是找出图像中可能存在相关文本候选的部分,然后将不相关的部分涂白。

但是,这些都是快速而肮脏的解决方案,当身份证在不同的照明条件下拍照时,或者如果它们被损坏,或者如果用于拍摄照片的设备具有广泛的相机,它们就会遇到困难。或者如果身份证的类型略有不同。我们在这个问题上做了很多工作,特别是在身份证件上。最终,我们的解决方案是对大量生成的图像使用机器学习,并训练 ML 模型只返回身份证中的相关文本。这需要大量的工作,但它得到了回报,因为我们现在可以提取非常可靠的数据,其中包括来自越南的 ID。

免责声明:我在 Microblink 工作,我们开发商业 OCR 产品,其中之一是用于 ID 扫描。

【讨论】:

  • 谢谢,我考虑过生成卡片并添加人工噪声和各种类型的失真,然后在它们上训练一个端到端的深度学习模型,但这听起来确实意义重大我现在试图避免的工作。我还没有尝试过 YUV 颜色空间,在这种情况下它们会比 HSV 更健壮吗?我会阅读更多关于它的内容。你的产品看起来棒极了!你有任何关于分许可的信息吗?很想通过私人信息联系和讨论更多。谢谢!
  • HSV 和 YUV 都可能比 RGB 颜色空间更好。对于这种特殊情况,我建议使用 YUV,因为文本是黑色的(Y、Cr 和 Cb 很小),而背景是浅色和彩色的(Y 和 Cb 很大)。在 HSV 中,H 和 S 很大程度上取决于光照条件。请随时与我们联系:microblink.com/contact-us.
猜你喜欢
  • 2022-10-17
  • 2020-01-28
  • 2014-12-03
  • 2017-04-18
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2011-02-06
  • 2013-10-03
相关资源
最近更新 更多