【发布时间】:2017-02-22 03:49:09
【问题描述】:
我对 Google Vision API 的 TEXT_DETECTION 感兴趣,它的效果令人印象深刻。但似乎 TEXT_DETECTION 仅在文本为英文时才给出准确的结果。在我的例子中,我想在一个非常狭窄的上下文中使用 TEXT_DETECTION,例如检测特定语言的广告横幅上的文本(在我的例子中是越南语)。我可以根据自己的数据收集训练机器以获得更准确的结果吗?以及如何实现这一点?
除了 Google Vision API 的 TEXT_DETECTION 之外,Google 还拥有使用 Tesseract 依赖项的 Google 光学字符识别 (OCR) 软件。据我所知,他们有不同的算法来检测文本。我使用 Google Docs 和 Google Vision API 的 TEXT_DETECTION 从图片中读取文本(越南语)。 Google Docs 给出了很好的结果,但 Vision API 没有。为什么 Google Vision API 没有继承 Google OCR 的优势?
我想说更多关于 Google Vision API 文本检测的内容,也许这里有任何 Google 专家都可以阅读此内容。正如 Google 宣布的那样,他们的 TEXT_DETECTION 非常棒:“即使这张图片中的单词倾斜且不清楚,OCR 仍能正确提取单词及其位置。它甚至可以识别出演示者 T 恤上的“信标”一词”。但是对于我的一些照片,发生的事情真的很有趣。例如this pic,即使图片中心的“Kem Oxit”字样很大,也无法识别。或者在this pic,图片中心的红色文字“HOA CHAT NGOC VIET”也无法识别。文本检测算法一定有问题。
【问题讨论】:
标签: google-cloud-platform google-vision