【发布时间】:2016-02-20 05:49:23
【问题描述】:
第 1 版 Google Cloud Vision API(测试版)允许通过 TEXT_DETECTION 请求进行光学字符识别。虽然识别质量很好,但返回的字符没有任何原始布局的提示。因此,结构化文本(例如表格、收据、列式数据)有时会被错误地排序。
是否可以使用 Google Cloud Vision API 保留文档结构? tesseract 和 hOCR 也有类似的问题。例如,[1] 和 [2]。目前在文档 [3] 中没有关于 TEXT_DETECTION 选项的信息。
[1]How to preserve document structure in tesseract [2]Tesseract - ambiguity in space and tab [3]https://cloud.google.com/vision/
【问题讨论】:
-
据我所知,API 识别的每一块文本都带有坐标。因此,如果您知道某种文本可能位于图像的顶部,您可以尝试调查放置在顶部的块;例如,如果您需要检查值表中的总和,您可能需要调查在 img 右下角识别的文本。我知道这远非理想情况,而且我还认为在将真实示例发送到 API 之前会更容易。但这就是我现在能想到的,试图解决这个“问题”。