【发布时间】:2011-12-03 12:28:58
【问题描述】:
我正在尝试使用 PHP 解析来自 OCR 引擎的布局信息,但它们没有提供任何详细信息。
我同时安装了 Tesseract(带有 Leptonica)和楔形文字。据说楔形文字在检测布局方面非常出色(即什么是文本,什么是图片等)输入是带有文本和图像的PNG文件(显然文本是图像的一部分。)
他们似乎都认为我想要输出为 txt、html 或 hocr...当我想要的是它认为是文本和它认为是图像的坐标时。
Cuneiform 有一个“native”输出选项,它是 Cuneiform 2000 格式,在 Notepad++ 中打开它我可以看到它被压缩了。我试过用 zip 和 gzip 提取它,但都没有识别出来。 Google 上也没有关于原生楔形文字格式的信息。
任何人知道如何从 Tesseract 或 Cuneiform 中提取布局信息...或者有更好的想法来计算包含文本块和图片的图像的布局?
【问题讨论】: