【发布时间】:2020-02-26 11:04:51
【问题描述】:
我正在基于 Tesseract 创建自定义 OCR 应用程序,我仍在做研发工作,我遇到了训练多页 tiff 文档以从中提取特定字段的问题,我该如何实现它?一旦它被训练,即将到来的相同文档将被自动提取或者我们需要手动干预?
对不起,我还处于研发阶段,我没有动手编码,我用谷歌搜索了很多但找不到合适的解决方案,请帮助我解决这个问题提前谢谢!!!
【问题讨论】:
我正在基于 Tesseract 创建自定义 OCR 应用程序,我仍在做研发工作,我遇到了训练多页 tiff 文档以从中提取特定字段的问题,我该如何实现它?一旦它被训练,即将到来的相同文档将被自动提取或者我们需要手动干预?
对不起,我还处于研发阶段,我没有动手编码,我用谷歌搜索了很多但找不到合适的解决方案,请帮助我解决这个问题提前谢谢!!!
【问题讨论】:
我使用 PIL 将 tiff 读入 ImageSequence,然后单独处理页面,因为如果需要可以并行完成。
from PIL import Image, ImageSequence
import pytesseract
im = Image.open(filename)
pages = ImageSequence.Iterator(im)
# n_pages = im.n_frames
for page in in pages:
im = im.convert('L')
pytesseract.image_to_data( ... )
【讨论】: