【发布时间】:2015-09-08 15:51:52
【问题描述】:
我正在做一个需要将 PDF 转换为文本的项目。 PDF 包含印地语字体(具体为 Mangal)和英语。
100% 的英语正在转换为文本。印地语部分的转换率约为 95%。剩余 5% 的印地语文本以空白或类似“ा” 的形式出现。我可以弄清楚重音字符没有正确转换为文本。
我正在使用以下代码:
pdftotext -enc UTF-8 pdfname.pdf textname.txt
PDF 使用以下字体
名称、类型、emb、sub、uni
ZDPKEY+Mangal,CID TrueType,是的,是的,是的
Mangal TrueType,不,不,不
Helvetica-Bold Type 1,不,不,不
CODUBM+Mangal-Bold,CID TrueType,是的,是的,是的
Mangal-Bold,TrueType,不,不,不
Times-Roman, Type 1 no, no, no
Helvetica,类型 1,不,不,不
以下是转换的结果。左侧是原始PDF。右侧是记事本中打开的文本:
http://preview.tinyurl.com/qbxud9o
我的问题是 5% 的缺失/垃圾字符是否可以在使用开源包的 Text 中正确捕获?非常感谢您的意见!
【问题讨论】:
-
它是扫描的 pdf 文件吗?您确定缺少的字符以文本形式存在于 pdf 文件中吗?也许 OCR 一开始就没有检测到这些字符。
-
嗨 Samik:这不是扫描的 PDF。这是一个“生成的”PDF。所有字符都出现在 PDF 中。我可以复制并粘贴到记事本中。