【发布时间】:2020-12-04 21:56:04
【问题描述】:
我有一个包含以下示例文本的 PDF 文档(屏幕截图)-
但是当我将它复制并粘贴到单词或其他文本编辑器时,我看到的只是奇怪的字符:
'
我不太清楚为什么它给了我奇怪的方框,而不是粘贴清晰的人类可读的字母(就像屏幕截图一样)。有人可以帮助我如何摆脱这个问题吗?或者至少我应该怎么做才能确定这个奇怪问题的根本原因?
【问题讨论】:
-
显然您的 pdf 缺少文本提取所需的条目。无需任何提示就可以显示字形,而无需任何关于将字形表示为字符的 unicode 代码点。
-
@mkl - 如果我理解正确,那么这个问题就不能再修复了吗?
-
根据 pdf 中不同字体对象的数量,您可以尝试在这方面注入信息,比较 this answer。另一种选择是 OCR...
-
感谢您的建议@mkl。我采用了 OCR 方法,并通过问题解决了。
标签: string pdf unicode character