【问题标题】:Unable to paste text in readable format from a PDF无法从 PDF 中粘贴可读格式的文本
【发布时间】:2020-12-04 21:56:04
【问题描述】:

我有一个包含以下示例文本的 PDF 文档(屏幕截图)-

但是当我将它复制并粘贴到单词或其他文本编辑器时,我看到的只是奇怪的字符:

  '      

我不太清楚为什么它给了我奇怪的方框,而不是粘贴清晰的人类可读的字母(就像屏幕截图一样)。有人可以帮助我如何摆脱这个问题吗?或者至少我应该怎么做才能确定这个奇怪问题的根本原因?

【问题讨论】:

  • 显然您的 pdf 缺少文本提取所需的条目。无需任何提示就可以显示字形,而无需任何关于将字形表示为字符的 unicode 代码点。
  • @mkl - 如果我理解正确,那么这个问题就不能再修复了吗?
  • 根据 pdf 中不同字体对象的数量,您可以尝试在这方面注入信息,比较 this answer。另一种选择是 OCR...
  • 感谢您的建议@mkl。我采用了 OCR 方法,并通过问题解决了。

标签: string pdf unicode character


【解决方案1】:

==================找到解决方法==================

  • 我尝试将文档损坏的 unicode 转换为标准的 ANSCI unicode 格式。但是大多数在线服务无法识别这些垃圾/怪异的字符。
  • 这个问题可以通过一些编程来解决,但我不想在编程方法上花费时间,而是首选动态方法。
  • 最后,按照用户“mkl”的建议,使用“Sedja”/“Adobe OCR”等 OCR 服务转换此文档,问题已解决。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-04-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-09-29
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多