【发布时间】:2017-05-17 09:29:05
【问题描述】:
我正在尝试使用 tesseract 从 png 中提取文本。在跟随 png 的情况下,Tesseract 不会提取文本。
图像中的黑色矩形有白色边框(由于网站背景不可见)。但是,如果我从矩形上删除白色边框,那么 Tesseract 能够检测到文本。有什么解决方法这个问题?
另外,如果减小边框大小,它会提取一些文本:
我 (31.04 我
这是我正在使用的代码:
using (TesseractEngine ocr = new TesseractEngine(dataPath, "eng", EngineMode.TesseractOnly))
{
using (Pix p = Pix.LoadFromFile(filePath))
{
using (Pix img = p.Scale(2,3))
{
using (var page = ocr.Process(img))
{
string text = page.GetText();
Console.WriteLine(text);
}
}
}
}
通过缩放,我可以提取以下文本:
I G1.04 I
但是,如果我增加边框大小,那么即使缩放图像也没有效果。
【问题讨论】:
-
实际上 Tesseract 甚至可以检测带有白色边框的文本。这可能是由于其他问题。尝试将图像转换为灰度并将其传递给 tesseract
-
"scale" 解决了我的问题。谢谢。