【问题标题】:Extracting and parsing specific layout info from OCR engine从 OCR 引擎中提取和解析特定的布局信息
【发布时间】:2011-12-03 12:28:58
【问题描述】:

我正在尝试使用 PHP 解析来自 OCR 引擎的布局信息,但它们没有提供任何详细信息。

我同时安装了 Tesseract(带有 Leptonica)和楔形文字。据说楔形文字在检测布局方面非常出色(即什么是文本,什么是图片等)输入是带有文本和图像的PNG文件(显然文本是图像的一部分。)

他们似乎都认为我想要输出为 txt、html 或 hocr...当我想要的是它认为是文本和它认为是图像的坐标时。

Cuneiform 有一个“native”输出选项,它是 Cuneiform 2000 格式,在 Notepad++ 中打开它我可以看到它被压缩了。我试过用 zip 和 gzip 提取它,但都没有识别出来。 Google 上也没有关于原生楔形文字格式的信息。

任何人知道如何从 Tesseract 或 Cuneiform 中提取布局信息...或者有更好的想法来计算包含文本块和图片的图像的布局?

【问题讨论】:

    标签: php layout ocr tesseract


    【解决方案1】:

    看看ABBYY FineReader Engine。它有一个非常智能的 API,可提供有关已识别文本的最大信息,包括其坐标。它不是免费的,但对于商业软件而言,ABBYY OCR 技术可以为您的产品增加重要价值。

    由于您正在使用 PHP 开发 Web 应用程序,因此您可能希望在 www.ocrsdk.com 使用 ABBYY OCR Engine Web API。它现在处于封闭测试阶段,所以现在可以免费使用。

    【讨论】:

    • ABBYY 在布局方面非常出色,但价格昂贵,我正在尝试尽可能快且便宜地做事。我不确定速度是否足够快或成本是否足够低以适合我的目的。但由于它是免费的测试版,所以我注册了,我会测试一下。感谢您的信息!
    • 如果您为 ABBYY 工作,请推动我的测试请求,因为我在截止日期前,如果它没有很快被接受,我将选择另一个解决方案。名字:Alasdair,不是一个普通的名字。谢谢。
    猜你喜欢
    • 2021-03-25
    • 1970-01-01
    • 2018-01-06
    • 2017-02-17
    • 1970-01-01
    • 1970-01-01
    • 2015-01-20
    • 2020-12-28
    • 1970-01-01
    相关资源
    最近更新 更多