【问题标题】:PDFtoTEXT not converting UTF-8 encoded text completely, especially the accented charactersPDFtoTEXT 未完全转换 UTF-8 编码文本,尤其是重音字符
【发布时间】:2015-09-08 15:51:52
【问题描述】:

我正在做一个需要将 PDF 转换为文本的项目。 PDF 包含印地语字体(具体为 Mangal)和英语。

100% 的英语正在转换为文本。印地语部分的转换率约为 95%。剩余 5% 的印地语文本以空白或类似“ा” 的形式出现。我可以弄清楚重音字符没有正确转换为文本。

我正在使用以下代码:

pdftotext -enc UTF-8 pdfname.pdf textname.txt

PDF 使用以下字体

名称、类型、emb、sub、uni

ZDPKEY+Mangal,CID TrueType,是的,是的,是的

Mangal TrueType,不,不,不

Helvetica-Bold Type 1,不,不,不

CODUBM+Mangal-Bold,CID TrueType,是的,是的,是的

Mangal-Bold,TrueType,不,不,不

Times-Roman, Type 1 no, no, no

Helvetica,类型 1,不,不,不

以下是转换的结果。左侧是原始PDF。右侧是记事本中打开的文本:

http://preview.tinyurl.com/qbxud9o

我的问题是 5% 的缺失/垃圾字符是否可以在使用开源包的 Text 中正确捕获?非常感谢您的意见!

【问题讨论】:

  • 它是扫描的 pdf 文件吗?您确定缺少的字符以文本形式存在于 pdf 文件中吗?也许 OCR 一开始就没有检测到这些字符。
  • 嗨 Samik:这不是扫描的 PDF。这是一个“生成的”PDF。所有字符都出现在 PDF 中。我可以复制并粘贴到记事本中。

标签: unix pdftotext xpdf


【解决方案1】:

将您的代码更改为。

pdftotext -enc "UTF-8" pdfname.pdf textname.txt

它对我有用,同样它应该对你有用。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-10-08
    • 2016-10-14
    • 1970-01-01
    • 1970-01-01
    • 2013-12-28
    • 2016-09-06
    • 1970-01-01
    相关资源
    最近更新 更多