【发布时间】:2019-01-01 20:26:33
【问题描述】:
我正在尝试使用 pytesseract 从图像中识别两个数字:
- 我试过
--psm 6到10 - 我试过
-c tessedit_char_whitelist=0123456789'
以上都不返回49 号码。我得到的最接近的是返回4 没有9
你有什么技巧可以让tesseract识别吗?
【问题讨论】:
标签: python ocr tesseract python-tesseract
我正在尝试使用 pytesseract 从图像中识别两个数字:
--psm 6 到10
-c tessedit_char_whitelist=0123456789'
以上都不返回49 号码。我得到的最接近的是返回4 没有9
你有什么技巧可以让tesseract识别吗?
【问题讨论】:
标签: python ocr tesseract python-tesseract
试试--psm 13 --oem 3(oem = 1 或 2 也应该这样做)
import pytesseract
from PIL import Image
import requests
import io
response = requests.get('https://i.stack.imgur.com/oAAXR.png')
text = pytesseract.image_to_string(Image.open(io.BytesIO(response.content)), lang='eng',
config='--psm 13 --oem 3 -c tessedit_char_whitelist=0123456789')
print(text)
在我的机器上产生 49,正如你所期望的那样。
我通过在本地下载图像并触发得到相同的结果
tesseract oAAXR.png output --oem 3 --psm 13 -l eng
作为参考,我的tesseract --version 给出了
tesseract 4.0.0 leptonica-1.77.0 libgif 5.1.4 : libjpeg 8d (libjpeg-turbo 2.0.1) : libpng 1.6.36 : libtiff 4.0.10 : zlib 1.2.11 : libwebp 1.0.1 Found AVX2 Found AVX Found SSE。
【讨论】:
你试过不同的--oem 吗?我也会尝试使用大于 10 的--psm。
【讨论】:
对我来说,以下命令只返回4:
tesseract oAAXR.png out --dpi 300 --psm 11 --oem 1 -c tessedit_char_whitelist=0123456789
使用:
tesseract 4.1.1-rc2-17-g6343
leptonica-1.76.0
libgif 5.1.4 : libjpeg 8d (libjpeg-turbo 1.5.2) : libpng 1.6.36 : libtiff 4.0.10 : zlib 1.2.11 : libwebp 0.6.1 : libopenjp2 2.3.0
Found AVX2
Found AVX
Found FMA
Found SSE
Found libarchive 3.3.3 zlib/1.2.11 liblzma/5.2.4 bz2lib/1.0.6 liblz4/1.8.3 libzstd/1.3.8
【讨论】: