【发布时间】:2010-12-02 03:34:18
【问题描述】:
我有一组图像,我在这些图像上运行 OCR 应用程序。此过程会生成一个带有字符偏移的 XML 文件。然后我使用 Acrobat 9 将图像转换为 PDF。现在,我想将 XML 文件信息作为不可见文本层添加到 PDF 中,以实现可搜索的 PDF。有没有简单免费的方法?
一些细节:
我不想使用 Acrobat 的 OCR 功能;
-
OCR 过程生成一个 XML 文件,其中包含以下元素:
<line baseline="1049" l="158" t="1012" r="1196" b="1060">This is a sample line of text from an image</line>
更新:也许可以用不同的方式做我想做的事。假设已经有一个从一组图像生成的 PDF 文件,并且其中已经包含 OCRed 文本。是否可以(可能以编程方式)仅访问每个页面的图像,对其进行处理(例如,将其转换为单色),并将其保存回 PDF 文件?如果是,则 OCRed 文本不会丢失。
[我应该将此更新放在一个单独的问题中吗?]
【问题讨论】:
-
你可能会发现hocr2pdf很有用