【发布时间】:2018-10-04 14:29:41
【问题描述】:
我通过在我的一张图片上运行以下命令创建了一个可搜索的 pdf 文件。
tesseract page.jpg test pdf --oem 1 --psm 5 -l urd
图像包含乌尔都语文本,但是当我从新创建的 pdf 文件中复制它并将其粘贴到任何其他文本编辑器中时,这就是我得到的。
GehbFie”
请任何可以解决我的问题的 tesseract OCR 和编码专家,任何帮助将不胜感激,在此先感谢。
【问题讨论】:
-
您是否尝试过 LibreOffice Writer、Microsoft WordPad 或 Microsoft Word?
-
当然,我尝试了很多不同的编辑器(sublime、notepad、notepadd++、ms word、WordPad)但是每个编辑器的结果都是一样的,我认为是编码问题。跨度>
-
非常好的兄弟我很高兴你正在尝试 OCR 乌尔都语。你的进展如何?您是否尝试过 Google Vision API OCR(包括乌尔都语)。 cloud.google.com/vision
标签: pdf cmd ocr tesseract urdu