【问题标题】:Tesseract - train with different image format than used for primary OCRTesseract - 使用与主要 OCR 不同的图像格式进行训练
【发布时间】:2016-06-24 10:09:57
【问题描述】:

正如在SO Question 中所讨论的,tesseract 通常使用 .png 文件比使用 .tiff 文件运行得更好。 (我自己也直接经历过)。不幸的是,可以处理 .png 文件的框编辑器较少。因此,我很想使用 .tiff 文件训练我的数据,然后将 .png 文件用于我的主要 OCR 工作。这样做会降低培训的效果吗?如果是这样,有什么方法可以解决它(除了找到一个可以接受 .png 文件的框编辑器)?

【问题讨论】:

    标签: tesseract


    【解决方案1】:

    一些编辑器,例如 jTessBoxEditor (Tesseract AddOns page) 支持 TIFF 和 PNG 格式。由于 TIFF 可以是多页图像,因此它可以为您的字符集提供比单页 PNG 更多的样本。

    https://github.com/tesseract-ocr/tesseract/wiki/TrainingTesseract

    【讨论】:

    • 有意思,谢谢!你知道,jTessBoxEditor 是我一直在使用的。我一直在尝试将它与 600dpi .png 文件(只有 212KB)一起使用,但它根本不会加载它。但是,当我切换到 500dpi 时,它仍然有效。我不太确定这是怎么回事。但是,根据我对 600dpi 文件的经验,我以前只是认为不可能与 .png 一起使用。但是,在阅读您的答案并尝试之后,它奏效了!也感谢您在该程序上所做的所有出色工作以及您在 SO 上提供的其他超级有用的答案。
    • 另外,为了不让 cmets 填写太多单独的问题,我发布了 this 新问题作为您对多页 .tif 图像的评论的后续。您对此的任何见解也将不胜感激!谢谢!
    • 除非内存不足,否则应该没有限制。尝试使用更大的 JVM 堆大小运行程序并再次加载 600dpi 图像。
    • 好的,谢谢。我仍然没有成功使用 600dpi 图像。我在 here 上创建了一个单独的问题
    猜你喜欢
    • 2012-11-05
    • 1970-01-01
    • 2020-06-17
    • 1970-01-01
    • 1970-01-01
    • 2022-10-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多