【问题标题】:How to apply MNIST trained NN on a big image如何在大图像上应用 MNIST 训练的 NN
【发布时间】:2021-05-04 21:57:27
【问题描述】:
我在 deeplearning4j 中有一个神经网络 (NN),使用 MNIST 进行训练,以识别图像上的数字。由于 MNIST 集包含 28x28 像素图像,我可以使用此 NN 预测 28x28 图像的类别。
我想了解如何将此 NN 应用到手写页面的图片上?如何将该图像中的文本转换为实际文本 (OCR)?基本上,需要什么样的预处理以及如何找出文本所在的图像部分?如何导出该图像的较小部分以单独应用 NN?
【问题讨论】:
标签:
image-processing
artificial-intelligence
deeplearning4j
handwriting-recognition
【解决方案1】:
您可能想探索 使用 Tensorflow 的 HTR(手写文本识别)。已经有一些有趣的实现可用并被广泛用作相同的基线模型。一个这样的可以找到here。
上面的架构详细说明了如何设计系统。当然,您可以进一步修改它以满足您的要求。
如果您正在处理数据组合,或试图了解此类图像的预处理步骤,here 是一个可以指导您的链接。
主要的预处理步骤是检测和裁剪单词,以便它们可以通过底层 TensorFlow HTR 或 tesseract 架构进行管理。
您可能想查看cropyble,它将裁剪和单词提取一次性打包。您可以专门使用它来裁剪图像以提取其他下游任务的单词序列