【问题标题】:Screenshot > Text (OCR) > Key information屏幕截图 > 文本 (OCR) > 关键信息
【发布时间】:2018-08-18 15:54:24
【问题描述】:

我正在使用 Google 的 Vision API 来分析来自我们产品的错误消息的屏幕截图。使用这些托管服务可以轻松实现 OCR 部分,但是是否有任何最佳实践工具可用于实际文本?

更具体地说,错误屏幕截图将包含产品名称、产品版本、底层操作系统版本(如果操作系统是 32 位或 64 位)以及实际错误消息(C# Stacktrace)

所以所有文本都来自 OCR 扫描,但由于屏幕截图是由用户拍摄的,因此不能假设上面的不同信息位于屏幕截图的特定区域。

如何分析这些数据?我们是在谈论简单的字符串操作和自定义领域知识(试过这个,它让我走得很远),还是这是 google/microsoft 提供的某种机器学习文本分析的工作(或者是矫枉过正)?

【问题讨论】:

  • 我不认为机器学习一定是矫枉过正,这取决于你正在处理多少不同的模式——你可以对图像进行 OCR 以生成文本数据集并训练有助于分类的模型这些错误不需要一堆正则表达式或用代码编写的规则。问题是你是否想完成这项工作。请记住,您需要预先准备好训练数据,并且可能需要随时保留训练模型以保持它们的准确性。

标签: machine-learning text computer-vision ocr


【解决方案1】:

所以所有文本都来自 OCR 扫描,但由于屏幕截图是由用户拍摄的,因此不能假设上面的不同信息位于屏幕截图的特定区域。

  1. 使用简单的Template matching 在屏幕截图中找到您正在寻找的错误消息窗口
  2. 在与您在第 1 步中找到的位置相关的特定区域中使用 Google 视觉 API,以获取特定信息。

【讨论】:

    猜你喜欢
    • 2014-02-25
    • 1970-01-01
    • 2012-01-31
    • 2019-11-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-04-06
    • 1970-01-01
    相关资源
    最近更新 更多