【问题标题】:How to get a 100% text extract using OCR?如何使用 OCR 获得 100% 的文本提取?
【发布时间】:2017-05-26 13:29:26
【问题描述】:

使用 GIT 代码,我们从图像中提取文本。但发现很少有挑战

  1. 转换过程中丢失了几个字符,大部分丢失的字符在开头。
    • 示例:当状态In Progress被提取时,文件中只写入n Progress
    • 如果状态为Assigned,则仅提取为ssigned
  2. 某些文本的转换有额外的空间
    • 提取事件编号INC123456789时,在文件中写为INC1234 56789
  3. 在某些情况下,角色本身会发生变化
    • 示例事件图片有带有文本的地图Google,当写入文件时它被转换为GooglA

有人遇到类似问题吗?并且知道如何获得 100% 的文本提取?

【问题讨论】:

  • 没有一种 OCR 方法是 100% 可靠的。没有办法说明如何改进您的特定案例,因为您没有展示任何示例图像,甚至没有告诉您正在使用什么软件。
  • 我认为即使是谷歌也不能吹嘘自己能够做到 100%
  • @litelite 是的。事实上,这就是 reCAPTCHA 背后的确切想法——让人类完成计算机出现故障的工作。
  • 我投票结束这个问题,因为它需要强大的人工智能。

标签: ocr


【解决方案1】:

也许尝试编写自己的机器学习模型,或者敢于编写自己的深度学习神经网络。

一个更简单的选择可能是尝试使用某种字典模型(最简单的例子是 Levenshtein 距离模型)映射常见错误,其中:

  • 您发现无效的词(即不在字典中)。使用 levenshtein 距离找到最接近的单词:
    • 文档中应使用的常用术语(看起来像合法词
    • 词典中的常用词(简称bag of words
  • 替换那些词
  • 更复杂(和可选)的方法是使用 ngram sentence correction 来纠正某些词组(例如.n ProgressIn Progress)
  • 运行语法检查以结束它(最好在此步骤使用 API

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-08-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-09-01
    • 1970-01-01
    • 2021-09-24
    • 2016-05-05
    相关资源
    最近更新 更多