【发布时间】:2012-01-28 19:05:57
【问题描述】:
我正在努力让林肯字体在 Tesseract 中工作,我得到的结果很糟糕,即使在通过 wildly complicated training process 之后也是如此。
这就是字体的样子,所以是的,这有点棘手:
我已经仔细制作了一张训练图像,然后用它制作了一个盒子文件。 The training image is here (25MB!)。图像为 300 DPI,具有代表性的字符很好地垂直和水平间隔。
我为训练图像制作了一个盒子文件,它工作正常。我已经使用a box file editor 验证了它是正确的。
我使用了这个 box 文件/tif 文件,并用它来创建训练数据。我对 Tesseract 提供的 30 or so other sample images/fonts 也是如此。
我创建了 unicharset 文件。
我创建了一个 font_properties 文件。网站上没有关于何时应该使用 fraktur 的指导。所以我已经尝试过这两种方式(林肯的 faktur on):
eng.lincoln.box 0 0 0 0 1
这样(fraktur off):
eng.lincoln.box 0 0 0 0 0
最后,我在有和没有字典文件的情况下都试过了。当我使用字典文件时,它们是来自我的搜索引擎 Sphinx 的词图,它们有大约 15K 的常用词和大约 20K 的不常用词。
在所有情况下,当我尝试对this file (3MB) 的前几行进行 OCR 时,质量都很糟糕。而不是得到:
United States Court of Appeals
for the Federal Circuit
我明白了:
OniteiJ %tates C0urt of QppeaIs
for the jfeI1eraICircuit
为什么?
【问题讨论】:
标签: ocr tesseract training-data