【问题标题】:Create images of words from text in an image从图像中的文本创建单词图像
【发布时间】:2011-10-05 17:45:39
【问题描述】:

有没有人知道任何库(最好是 Java,但我会看任何东西)可以让我分解图像中的文本并为每个单词创建更小的图像?我已经测试了GOCR 和tesseract,但我不打算转录文本,并且在许多情况下,例如手写笔记或功能不佳的打字机,文本无论如何都必须由人类转录。大多数文本是西班牙语的事实也使 OCR 更加困难。我搜索了 stackoverflow 档案,没有找到任何东西。我的问题的目的是在大学里,我们有数十万份非常古老的手写笔记,如果我可以将它们逐字分解成更小的图像,那么我们可以尝试转录和翻译它们。

【问题讨论】:

  • 提醒一下,请考虑到许多单词只能在上下文中翻译,而不能单独翻译(英语与同音异义词很糟糕,例如 - wind [pushes clouds] 和 wind [up a clock]) .
  • 是的。在这一点上,我什至对翻译都不感兴趣。它只是在每个单词周围创建一个框,然后将其保存为图像以供以后转录。感谢您的帮助。

标签: java image image-manipulation ocr text-extraction


【解决方案1】:

http://sourceforge.net/projects/javaocr/

特别是,下面的截图似乎与你所追求的有关。

【讨论】:

  • 感谢您的回复!这是一个很好的起点,但我将不得不调整它以用于草书手写。我不需要将文本逐字逐句分解成小图像。
猜你喜欢
  • 2011-12-10
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2011-07-03
  • 2012-01-04
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多