【发布时间】:2020-03-04 11:10:58
【问题描述】:
我正在使用 tesseract 的当前 alpha 版本 5。目前,我正在尝试使用没有字体文件的图像进行训练。我设法使用以下命令从图像生成盒子文件。
tesseract image.tif imagebox -l ara wordstrbox
在这一步之后,我将修复 OCR 中的错误。然后我需要将box文件和tif转换成.lstmf文件。
我找不到任何有关如何执行此操作的指导。所有有以下内容: OCR training documentation
训练数据通过 .lstmf 文件提供,这些文件是序列化的 DocumentData 它们包含图像和相应的 UTF8 文本转录,并且可以使用 Tesseract 以类似于 .tr 文件的方式从 tif/box 文件对生成是为旧引擎创建的。
请告知现阶段如何将 tif 和 box 转换为 lstmf。
谢谢,
【问题讨论】:
标签: tesseract