【发布时间】:2020-05-19 11:09:07
【问题描述】:
我将 CRNN (CNN+RNN+CTCLoss) 用于我的 OCR。我的数据集是 10000 个图像文本(7000 个训练+有效和 3000 个测试)
我的架构受到 VGG-16 的启发,我使用了 13 个 conv 层和 3 个双向 LSTM 层,并且我使用了 CTC Loss。 这是我的架构(培训):
我不知道为什么,但我的输出只预测了我所有数据集的“p”字符。
我不能把我所有的代码都放在这里,所以你们都可以在这里看到我的代码: https://colab.research.google.com/drive/1Mio5i6ySlSPnSs1o1sc-WpgfYLu9i9iy?usp=sharing
问题:为什么我的预测只是“p”?是因为我的数据集不多还是因为我的架构?以及如何减少我的损失???谢谢
【问题讨论】:
标签: image machine-learning testing ocr prediction