【问题标题】:Tesseract Train .TIff Files正方体训练 .TIff 文件
【发布时间】:2020-02-26 11:04:51
【问题描述】:

我正在基于 Tesseract 创建自定义 OCR 应用程序,我仍在做研发工作,我遇到了训练多页 tiff 文档以从中提取特定字段的问题,我该如何实现它?一旦它被训练,即将到来的相同文档将被自动提取或者我们需要手动干预?

对不起,我还处于研发阶段,我没有动手编码,我用谷歌搜索了很多但找不到合适的解决方案,请帮助我解决这个问题提前谢谢!!!

【问题讨论】:

    标签: python ocr tesseract tiff


    【解决方案1】:

    我使用 PIL 将 tiff 读入 ImageSequence,然后单独处理页面,因为如果需要可以并行完成。

    from PIL import Image, ImageSequence
    import pytesseract
    
    im = Image.open(filename)
    pages = ImageSequence.Iterator(im)
    # n_pages = im.n_frames
    for page in in pages:
        im = im.convert('L')
        pytesseract.image_to_data( ... )
    

    【讨论】:

    • 如何训练图像以从中获取特定领域有什么想法吗?
    • 你能帮我吗?
    猜你喜欢
    • 2016-02-12
    • 2012-08-05
    • 2020-06-21
    • 2020-01-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-11-26
    • 2015-10-23
    相关资源
    最近更新 更多