【发布时间】:2017-05-26 13:29:26
【问题描述】:
使用 GIT 代码,我们从图像中提取文本。但发现很少有挑战
- 转换过程中丢失了几个字符,大部分丢失的字符在开头。
- 示例:当状态
In Progress被提取时,文件中只写入n Progress。 - 如果状态为
Assigned,则仅提取为ssigned
- 示例:当状态
- 某些文本的转换有额外的空间
- 提取事件编号
INC123456789时,在文件中写为INC1234 56789
- 提取事件编号
- 在某些情况下,角色本身会发生变化
- 示例事件图片有带有文本的地图
Google,当写入文件时它被转换为GooglA
- 示例事件图片有带有文本的地图
有人遇到类似问题吗?并且知道如何获得 100% 的文本提取?
【问题讨论】:
-
没有一种 OCR 方法是 100% 可靠的。没有办法说明如何改进您的特定案例,因为您没有展示任何示例图像,甚至没有告诉您正在使用什么软件。
-
我认为即使是谷歌也不能吹嘘自己能够做到 100%
-
@litelite 是的。事实上,这就是 reCAPTCHA 背后的确切想法——让人类完成计算机出现故障的工作。
-
我投票结束这个问题,因为它需要强大的人工智能。
标签: ocr