【问题标题】:What's the best way to detect garbled text in an OCR-ed document在 OCR-ed 文档中检测乱码文本的最佳方法是什么
【发布时间】:2011-06-17 05:48:01
【问题描述】:

是否有任何好的 NLP 或统计技术来检测 OCR 文本中的乱码?我突然想到,查看文本中 n-gram 的分布可能是一个很好的起点,但我对整个 NLP 领域还是很陌生。

这是我目前看到的:

文本将主要是英文,但一般的解决方案会很好。该文本目前在 Lucene 中被编入索引,因此任何关于基于术语的方法的想法也会很有用。


任何建议都会很棒!谢谢!

【问题讨论】:

    标签: text statistics nlp ocr


    【解决方案1】:

    是的,在这种情况下最强大的东西是 Ngram。您应该在相关的文本语料库中收集它们(与您的 OCR 文本具有相同的主题)。这个问题与拼写检查非常相似——如果小的字符变化导致很大的概率增加,那就是一个错误。检查this tutorial 如何使用 ngram 进行拼写检查。

    【讨论】:

      【解决方案2】:

      几年前我使用了 n-grams,结果相当不错。我使用了 Apache Nutch 的语言检测器,它在内部使用单词和词内 n-gram。然后将文本的“ngram-profile”与培训材料的 n-gram 配置文件进行比较。除了语言之外,Nutch 还给出了分数/置信度值,我使用了基于语言(应该是文档所在的语言)和分数的硬截断值。保留大部分乱码文本,但计算成本有点高。

      【讨论】:

        猜你喜欢
        • 2020-11-20
        • 2016-01-27
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-06-08
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多