【问题标题】:What does the Tesseract OCR library require of an image to be able to accurately extract text?Tesseract OCR 库需要什么图像才能准确提取文本?
【发布时间】:2016-01-10 23:39:50
【问题描述】:

我正在使用 Tesseract 库从图像中提取文本。语言是越南语。我有两张图片。第一个来自一个网站。第二个是从写字板程序截取的屏幕截图。它们显示在下面的链接中:

1

2

第一个有 95% 的准确率。

Bán căn hộ tầng 5 khu tập thể Thành công Bắc, DT 28m2, gần chợ ThànhCông, 所以 đỏ, chính chủ, giá 800 triệu.LH:A.Châu, 0979622551,0905685336

第二张图片要大得多,但准确率只有 60% 左右。

Bặn căn hộ tầng ậ khu tập thể Ỉhành gông 巴克。 llĩ 28 平方米。 gân chợ ĩllành Bông。 sũIlỏ。 chính l:lIlì。 giá 800 lriệu。 l.ll: A.BhâU, 0979622551, 0905685336

我必须修复第二张图片才能获得与第一张一样准确的文本吗?

【问题讨论】:

  • 尝试为第二种字体重新训练 Tesseract。

标签: ocr tesseract


【解决方案1】:

正如@user898678 在image processing to improve tesseract OCR accuracy 中所说,
以下操作可以提高 OCR 的准确性:

  • 修复 DPI(如果需要)最低 300 DPI
  • 修正文本大小(例如 12 pt 应该没问题)
  • 尝试修复文本行(去歪斜和扭曲文本)
  • 尝试修复图像的照明(例如,图像没有暗部 对图像进行二值化和去噪

【讨论】:

  • 第二张图片的字体文字大小大于12pt。图像中的单词在同一条直线上。此外,我没有看到图像的任何黑暗部分。我正在考虑如何提高第二张图片中文本的粗体级别。这可能会解决问题,但我不知道如何
猜你喜欢
  • 2012-03-17
  • 1970-01-01
  • 2012-11-10
  • 2021-06-30
  • 2021-04-20
  • 2016-10-09
  • 1970-01-01
  • 2017-04-03
相关资源
最近更新 更多