【问题标题】:Can text structure be retained using Google Cloud Vision TEXT_DETECTION?可以使用 Google Cloud Vision TEXT_DETECTION 保留文本结构吗?
【发布时间】:2016-02-20 05:49:23
【问题描述】:

第 1 版 Google Cloud Vision API(测试版)允许通过 TEXT_DETECTION 请求进行光学字符识别。虽然识别质量很好,但返回的字符没有任何原始布局的提示。因此,结构化文本(例如表格、收据、列式数据)有时会被错误地排序。

是否可以使用 Google Cloud Vision API 保留文档结构? tesseract 和 hOCR 也有类似的问题。例如,[1] 和 [2]。目前在文档 [3] 中没有关于 TEXT_DETECTION 选项的信息。

[1]How to preserve document structure in tesseract [2]Tesseract - ambiguity in space and tab [3]https://cloud.google.com/vision/

【问题讨论】:

  • 据我所知,API 识别的每一块文本都带有坐标。因此,如果您知道某种文本可能位于图像的顶部,您可以尝试调查放置在顶部的块;例如,如果您需要检查值表中的总和,您可能需要调查在 img 右下角识别的文本。我知道这远非理想情况,而且我还认为在将真实示例发送到 API 之前会更容易。但这就是我现在能想到的,试图解决这个“问题”。

标签: google-cloud-vision


【解决方案1】:

识别文本结构是一个比识别文本本身更抽象的概念:字母、单词、句子。如果您的文件元数据中已经包含此文本结构信息,您可以执行以下操作:

  • 在子部分中分割/划分您的输入图像。
  • 执行您的 text_detection 请求。
  • 根据您的元数据正确地重新排序您的文本。

我不是 Cloud Vision text_detection API 方面的专家,但它写的是 text_detection 而不是 language_detection 或 text_structure_detection,因此它提供了一些关于检测级别/层的小线索。

也许这是他们计划在未来添加或在文档中描述的功能。

【讨论】:

  • 费用是按图像计算的,因此对于复杂的结构,将图像分成子部分可能会非常昂贵。
猜你喜欢
  • 2017-07-07
  • 1970-01-01
  • 1970-01-01
  • 2018-06-13
  • 1970-01-01
  • 1970-01-01
  • 2019-04-08
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多