【发布时间】:2011-06-17 05:48:01
【问题描述】:
是否有任何好的 NLP 或统计技术来检测 OCR 文本中的乱码?我突然想到,查看文本中 n-gram 的分布可能是一个很好的起点,但我对整个 NLP 领域还是很陌生。
这是我目前看到的:
- N-gram Statistics in English and Chinese: Similarities and Differences
- Statistical Distributions of English Text
文本将主要是英文,但一般的解决方案会很好。该文本目前在 Lucene 中被编入索引,因此任何关于基于术语的方法的想法也会很有用。
任何建议都会很棒!谢谢!
【问题讨论】:
标签: text statistics nlp ocr