【问题标题】:Special Character Whitelist with Tesseract (OCR)使用 Tesseract (OCR) 的特殊字符白名单
【发布时间】:2018-01-19 05:13:46
【问题描述】:

我试图通过 OCR 读出一些货币价值,问题是我想告诉他他应该识别哪些字符。

这是我目前的白名单

       Version : Tesseract from Charles Weld v3.0.2
       tessedit_char_whitelist "0123456789,.$"

如何包含美分 (¢) ?

更新 1:如果我将 ¢ 添加到列表中,它将无法识别。

【问题讨论】:

  • tessedit_char_whitelist = "0123456789,.$¢"?
  • @juharr 试过第一次没用 :(...
  • 那绝对是您应该在问题中包含的信息。

标签: c# char ocr tesseract whitelist


【解决方案1】:

好吧,在我第一次有更相关的答案时未能理解问题。

ocr.SetVariable("tessedit_char_whitelist", "0123456789,.$¢");

以字符串形式提供参数名称和值,就像在配置文件中一样。比如

SetVariable("tessedit_char_whitelist", "xyz"); to whitelist x, y and z. 

还要确定

SetVariable("classify_bln_numeric_mode", "1 or 0"); 

设置纯数字模式或禁用纯数字模式。哪一个满足您的需求我猜在您的情况下它应该被禁用,因为您使用字符和数字。

希望这会有所帮助!如果不让我知道,我会删除答案(我必须使用答案,因为我不能在 50 代表以下发表评论,否则我会先发表评论以获得有关该问题的更多信息)干杯!

【讨论】:

猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-09-22
  • 2013-02-18
  • 1970-01-01
  • 2018-08-09
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多