【发布时间】:2011-10-05 17:45:39
【问题描述】:
有没有人知道任何库(最好是 Java,但我会看任何东西)可以让我分解图像中的文本并为每个单词创建更小的图像?我已经测试了GOCR 和tesseract,但我不打算转录文本,并且在许多情况下,例如手写笔记或功能不佳的打字机,文本无论如何都必须由人类转录。大多数文本是西班牙语的事实也使 OCR 更加困难。我搜索了 stackoverflow 档案,没有找到任何东西。我的问题的目的是在大学里,我们有数十万份非常古老的手写笔记,如果我可以将它们逐字分解成更小的图像,那么我们可以尝试转录和翻译它们。
【问题讨论】:
-
提醒一下,请考虑到许多单词只能在上下文中翻译,而不能单独翻译(英语与同音异义词很糟糕,例如 - wind [pushes clouds] 和 wind [up a clock]) .
-
是的。在这一点上,我什至对翻译都不感兴趣。它只是在每个单词周围创建一个框,然后将其保存为图像以供以后转录。感谢您的帮助。
标签: java image image-manipulation ocr text-extraction