【发布时间】:2020-10-27 05:34:23
【问题描述】:
我一直在尝试从 PDF 文件中提取文本,并且大多数文件似乎都可以正常工作。但是,一个特定的文档中的文本采用了这种不寻常的字体:in solid
我曾尝试使用 PHP 和 Python 进行提取,但两者都无法修复此字体。我尝试复制文本并尝试查看是否可以在文本编辑工具中修复它,但无法做太多。请注意,原始 PDF 文档看起来不错,但是当文本在文本编辑工具中复制和粘贴时,两者之间的差距字符开始出现。我完全不知道该怎么做。请提出一个解决方案来解决这个问题在 PHP/Python(最好是 PHP)中。
【问题讨论】:
-
它不是一种不寻常的字体,而是一种名为 Fullwidth Latin 的不寻常的 unicode 块。来自维基百科的一般信息en.wikipedia.org/wiki/…。您可以使用
unicodedata模块获取更多信息。例如,unicodedata.name("i")
标签: python php pdf fonts character-encoding