【问题标题】:Parsing PDF with russian text and tabula-py returns ???? in result. ( on windows)用俄语文本和 tabula-py 解析 PDF 返回 ????结果。 (在窗户上)
【发布时间】:2019-01-18 02:17:48
【问题描述】:

我使用的是 32 位的 Windows 7。当我解析俄语文本 PDF 时,我收到带有 ??? 的结果文件而不是俄语字符。 开发人员通过此修复解决了此问题

我知道了?在 Windows 上带有结果的字符。我怎样才能避免它?如果 PDF 的编码是 UTF-8,你应该在你的终端上设置 chcp 65001 在启动 Python 进程之前。

chcp 65001

我在 windows cmd 中更改了这个但没有结果。

我的代码

import tabula


tabula.convert_into(r"C:\Code\Active\kartoteka\misc\ExampleExtract.pdf", r"C:\Code\Active\kartoteka\misc\output.csv", output_format="csv",pages = "all",java_options="-Dfile.encoding=utl-8")

错误日志:

?? 10, 2018 11:15:18 PM org.apache.pdfbox.pdmodel.font.PDCIDFontType2Font getawtFont
INFO: Can't read the embedded font Times-Roman
??? 10, 2018 11:15:18 PM org.apache.pdfbox.pdmodel.font.PDCIDFontType2Font getawtFont
INFO: Using font Times New Roman instead
??? 10, 2018 11:15:19 PM org.apache.pdfbox.pdmodel.font.PDCIDFontType2Font getawtFont
INFO: Can't read the embedded font Times-Roman
??? 10, 2018 11:15:19 PM org.apache.pdfbox.pdmodel.font.PDCIDFontType2Font getawtFont
INFO: Using font Times New Roman instead

我生成的文件仍然在 ????? 中显示所有俄语字符 你如何解决这个问题?

这就是原始 PDF 的外观。

【问题讨论】:

标签: python-3.x tabula


【解决方案1】:

注意事项:我的评论是关于从 PDF 中正确提取文本的能力与特别是从 tablula-py 中提取文本的能力,但希望这可以帮助您确定问题出在您的 PDF 还是您的 PDF 软件。

很难在没有看到的情况下评论您正在查看的文件,但一个好的起点是尝试 Acrobat,通过复制文本并将其粘贴到文本编辑器或搜索文本内容将显示是否提取正确与否。

如果无法正确提取,则该字体很可能缺少 ToUnicode 条目(有关详细信息,请参阅 ISO PDF 32000-1:2008 规范的第 9.10.1 节)。

如果 Acrobat 可以正确提取文本,则可能是您使用的 PDF 软件存在问题。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2019-01-10
    • 1970-01-01
    • 1970-01-01
    • 2016-06-01
    • 2013-10-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多