【问题标题】:Tesseract Training - new font with only digits正方体训练 - 只有数字的新字体
【发布时间】:2016-03-26 18:21:41
【问题描述】:

您好,我尝试根据以下数字为新字体训练 tesseract:

所有数字都以透明背景的 png 文件提供。如果我从中创建一个盒子文件,训练它等等 - 一切正常!

现在的问题,同样的情况,但我想根据下图训练 tesseract:

如您所见,数字和位置等完全相同。与图 1 的唯一区别是我使用了黄色背景,从现在开始就没有任何效果了。我创建了一个盒子文件,并设置了与第一张图片相同的位置:

0 5 4 20 22 0
1 27 4 38 21 0
2 48 4 60 22 0
3 71 3 83 22 0
4 94 5 109 22 0
5 119 5 131 22 0
6 143 5 157 22 0
7 172 5 184 22 0
8 197 5 211 23 0
9 224 5 238 22 0

然后我训练了这个盒子,但是生成的 .tr 文件完全是空的,我没有停在这里并完成了所有其他步骤。生成的字体无法使用!

所以我的问题是如何训练 tesseract 来识别这些数字,无论它们使用哪种背景?

编辑 2016-04-16:

我使用ImageMagick 对图像进行预处理,我发现了一个适用于各种背景的命令。所以我想为这个创建的图像训练 tesseract,但它并没有像我想象的那样工作...... 首先,我创建了盒子文件,其中大部分是空的。好吧,我用一个网站来组织角色的位置,我花了很多时间来完美地裁剪!之后我创建了生成的 .tr 文件并做了其他的东西来训练 tesseract。

最后我得到了“traineddata”,我把文件移到了 tesseract 的“tessdata”目录中,并像应该使用的那样使用它:

tesseract example.jpg output -l mg

(我称新字体为“mg”)

好吧,不管它不能识别全部或大部分!我打开这个线程寻求帮助,直到现在没有人真正知道如何做到这一点,可悲的是......。请帮帮我。

我使用和创建的整个 tesseract 训练文件,你可以在这里找到:

Tesseract training directory(因为没有 zip/未压缩 -> 目录下所有文件的视图)

【问题讨论】:

  • 可能是 OT,但您可以预处理以去除背景颜色。

标签: ocr tesseract training-data


【解决方案1】:

您可以将任何彩色图像更改为二进制图像,然后在其上使用 tesseract,这样无论您使用什么颜色,您都将始终得到相同的结果。

【讨论】:

    猜你喜欢
    • 2020-01-27
    • 2017-05-08
    • 2016-02-12
    • 1970-01-01
    • 1970-01-01
    • 2012-08-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多