【问题标题】:Tesseract struggles do identify clear wordTesseract 的斗争确实识别出清晰的单词
【发布时间】:2017-01-08 19:50:35
【问题描述】:

我有一张大约 320dpi 的图像。我正在裁剪一个部分,使其成为灰度并对其进行二值化(阈值)以使其更清晰。看起来是这样的:

对我来说似乎很清楚,它应该不难识别,但 tesseract 似乎永远无法获取文本。我试过 psm 6,7,8 但没有一个能解决它。

tesseract (v3) 不起作用,我做错了什么。

【问题讨论】:

    标签: ocr tesseract python-tesseract


    【解决方案1】:

    你需要申请

    准确识别需要上采样。阈值化将使字符的功能可用。

    阈值化结果:

    现在你读到了:

    Allin
    

    代码:


    import cv2
    import pytesseract
    
    img = cv2.imread('3Po5A.png')
    gry = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY)
    (h, w) = gry.shape[:2]
    gry = cv2.resize(gry, (w*2, h*2))
    thr = cv2.threshold(gry, 0, 255, cv2.THRESH_BINARY + cv2.THRESH_OTSU)[1]
    txt = pytesseract.image_to_string(thr, config="--psm 6")
    print(txt)
    cv2.imshow("thr", thr)
    cv2.waitKey(0)
    

    请注意,您可以使用不同的preprocessing techniques 获得相同的结果。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-01-03
      • 1970-01-01
      • 2016-06-19
      • 1970-01-01
      • 2014-01-16
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多