【问题标题】:Blackout number in pdf using OCR使用 OCR 的 pdf 中的黑屏编号
【发布时间】:2019-06-01 12:05:26
【问题描述】:

有3页扫描身份证的PDF。身份证复印件可以在我需要涂黑身份证号码的任何页面上(身份证号码格式 - 12位数字和两个空格,即xxxx xxxx xxxx)

请建议我如何实现这一目标

我尝试了微软计算机视觉 OCR 服务,但无法集成代码

需要自动化这个任务

找到输入和预期的输出文件 Input and Outputfile

【问题讨论】:

    标签: c# computer-vision ocr tesseract python-tesseract


    【解决方案1】:

    我会定位 qrcode(python 有几个 zbar 包)和它下面的干净区域 - 尺寸可以通过 qr 代码大小计算...

    【讨论】:

    • 我无法找到 QR 码,因为它是 pdf 中的扫描图像,tesseract ocr 可以为我提供 pdf 中的文本坐标
    • 能否tesseract可以给出文本元素的边界框或坐标
    • 可以。您可以尝试从中提取衬里(我无法格式化代码:-(): import pytesseract pytesseract.pytesseract.tesseract_cmd = r"/path/bin/tesseract" tessdata_dir_config = r'''--tessdata-dir "path /to/tessdata_best/tessdata"''' data = pytesseract.image_to_data(Image.open('test2.jpg'), lang='eng', config=tessdata_dir_config, output_type=pytesseract.Output.DICT)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-02-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多