【问题标题】:Transform an image of handwritten notes to text [closed]将手写笔记的图像转换为文本[关闭]
【发布时间】:2019-10-15 12:46:30
【问题描述】:

我有数百张手写笔记的图片。它们是由不同的人写的,但它们是按顺序写的,所以你知道,例如 person1 写的是 img1.jpg -> img100.jpg。笔迹风格因人而异,但有些部分的笔记总是固定的,我想这对算法有帮助(它对我有帮助!)。

我尝试了tesseract,但它在识别文本方面非常失败。我在想,因为每个人都有大约 100 张图像,我是否可以通过提供少量示例(例如 5 个或更少)来训练算法,并且可以从中学习?还是数据不够?从四处搜索看来我需要实现CNN(例如this paper)。

虽然我对ai 的了解有限,但我仍然可以通过图书馆和一些学习来做到这一点吗?如果是这样,我应该怎么做?

【问题讨论】:

  • 您可以做的是,获取每张图像并从中提取每个单词(使用预训练的 CNN)——然后将每个单词组合成一个句子。否则,您可以查看 RNN/LSTM,但我会先使用 CNN

标签: java python artificial-intelligence conv-neural-network handwriting-recognition


【解决方案1】:

这被称为OCR,并且已经取得了进展。实际上,这是一个使用tesseract 将图像文件解析为文本的简单示例:

try:
    from PIL import Image
except ImportError:
    import Image
import pytesseract


def ocr_core(file):
    text = pytesseract.image_to_string(file)
    return text


print(ocr_core('sample.png'))

但是

我不太确定它能否识别不同类型的笔迹。您可以自己尝试一下以找出答案。如果您想尝试python 示例,您需要导入tesseract,但首先要在您的操作系统上安装tesseract 并将其添加到您的PATH。

【讨论】:

【解决方案2】:

市面上有许多 OCR,其​​中一些的性能比其他的好。然而,这是一个最近通过深度神经网络得到了很大改进的领域。我会考虑使用 Azure、Google Cloud 或 Amazon 等云提供商。您上传图片,他们会返回元数据。

例如: https://azure.microsoft.com/en-us/services/cognitive-services/computer-vision/

如果你出于任何原因不想使用云服务,我会考虑使用 TensorFlow……但需要一些知识:

Tensorflow model for OCR

【讨论】:

  • 我会尝试Tensorflow 然后tesseract 似乎无法处理这个手写笔记。
猜你喜欢
  • 1970-01-01
  • 2016-02-19
  • 2015-12-16
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-05-12
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多