【问题标题】:text is being changed when i do copy it from searchable pdf file (created with tesseract command) and paste it in notepad当我从可搜索的 pdf 文件(使用 tesseract 命令创建)复制文本并将其粘贴到记事本中时,文本正在被更改
【发布时间】:2018-10-04 14:29:41
【问题描述】:

我通过在我的一张图片上运行以下命令创建了一个可搜索的 pdf 文件。

tesseract page.jpg test pdf --oem 1 --psm 5 -l urd

这是我已转换为可搜索 pdf 的图像。

图像包含乌尔都语文本,但是当我从新创建的 pdf 文件中复制它并将其粘贴到任何其他文本编辑器中时,这就是我得到的。

GehbFie”

请任何可以解决我的问题的 tesseract OCR 和编码专家,任何帮助将不胜感激,在此先感谢。

【问题讨论】:

  • 您是否尝试过 LibreOffice Writer、Microsoft WordPad 或 Microsoft Word?
  • 当然,我尝试了很多不同的编辑器(sublime、notepad、notepadd++、ms word、WordPad)但是每个编辑器的结果都是一样的,我认为是编码问题。跨度>
  • 非常好的兄弟我很高兴你正在尝试 OCR 乌尔都语。你的进展如何?您是否尝试过 Google Vision API OCR(包括乌尔都语)。 cloud.google.com/vision

标签: pdf cmd ocr tesseract urdu


【解决方案1】:

pdf 是配置文件名。它需要在命令中排在最后,在 --oem --psm -l 等之后。

命令的正确格式如下。

tesseract page.jpg test --oem 1 --psm 5 -l urd pdf

我通过这种方式解决了我的问题。

【讨论】:

  • بہت اعلیٰ بھائی بہت خوشی ہوئی سن کر۔ ابھی اس کام میں آپ کو کہاں تک کامیابی ہوئی ہے۔ فوگل اوسی آر رہا ہوں بہت اعلیٰ ہے ۔ اس جیسی ٩وئی اور او سی آر اردو کے لیے میں نے نہیی آپ کا تجربہ کیسے ہے ضرور شیئر کریں جزاک اللہ
猜你喜欢
  • 2019-02-25
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-03-11
  • 1970-01-01
  • 1970-01-01
  • 2021-07-09
相关资源
最近更新 更多