【发布时间】:2012-04-28 21:31:53
【问题描述】:
我在一个项目中使用 tesseract,想知道 tesseract 的最佳图像输入类型以提供最佳输出。 Binary&TIFF 是最好的输入还是其他?
【问题讨论】:
标签: image-processing ocr tesseract
我在一个项目中使用 tesseract,想知道 tesseract 的最佳图像输入类型以提供最佳输出。 Binary&TIFF 是最好的输入还是其他?
【问题讨论】:
标签: image-processing ocr tesseract
过去,我在使用 TIFF 完成类似任务时取得了出色的成绩。当时我使用 OpenCV 做了一些pre-processing 并将结果导出到 TIFF 文件,该文件后来被发送到 tesseract。挺好的。
【讨论】:
我发现 TIFF 比 jpg 提供的结果要好得多,并且是对所有其他类型最好的。
原来的 Tesseract 程序只能处理 TIFF 文件,这让我相信它是最合适的
【讨论】:
使用 .tif 的优点是 (1) scantailor 输出 .tif 文件和 (2) 可以使用 tiffcp 将单个 .tif 合并为一个可以馈送到 tesseract 的多页文件。困难在于,如果您让 tesseract 输出 .pdf,那么您无法控制所创建的 .pdf 类型。使用pdfimages -list,我发现它以与输入相同的 dpi 输出 .ccitt 和 .jpeg 的组合。然后,尝试使用 imagemagic 将其转换为较低的 dpi 或其他压缩方式会导致效果不佳。
我发现的替代方法是首先使用 imagemagic 将所有 .tif 转换为 .png。然后将 .png 逐个提供给 tesseract,为每个 .png 生成一个 .pdf。在这种情况下,.pdf 现在包含光栅图像。然后可以使用 imagemagic 组合和重新编码。
我在这里能看到的唯一缺点是 if tesseract 正在学习 OCR 的文档(我不知道它是,但它可能是),那么我们想给出一次查看整个文档,而不是一次一页。
【讨论】: