【问题标题】:quickly inspect OCR text layer on PDF file快速检查 PDF 文件上的 OCR 文本层
【发布时间】:2017-11-17 18:57:01
【问题描述】:

是否有任何程序可以让我将 PDF 的文本 (OCR) 层叠加在 PDF 渲染之上?

我想快速查看文本层是否有错误。

如果可以通过程序完成会更方便,如果没有,一些cli命令或脚本也可以工作。

【问题讨论】:

  • 您希望使用哪种编程语言来实现该程序?您的 OCR 程序是如何添加文本的? (在渲染模式下绘制“不可见”?定期在下面绘制文本?...)
  • Python 没问题。我使用 ocrmypdf 添加文本。
  • 不幸的是,我只能帮助使用 java 或 c# pdf 库。尽管如此,并不是每个人都知道“ocrmypdf”,因此该提示并不能真正回答该程序如何添加文本。如果您不了解自己,请分享带有 ocr'ed 文本的示例。
  • Java 或 C# 也可以。我的意思是 OCR 数据“夹在”文档中。
  • 这是一个带有 ocr 层的 pdf 示例:docdro.id/G97YGFO

标签: pdf ocr


【解决方案1】:

叠加?这意味着您想要添加文本,而我相信您想要访问文本以进行检测并可能进一步分析 OCRed 文本质量。也许需要进一步澄清。

我们的开发人员在算法方面研究了一段时间,以检测 PDF 中是否存在文本,然后评估其质量。有许多情况可以欺骗基本算法 - 添加到纯图像 PDF 中的 Bates 编号或印记器使 PDF 看起来具有高质量文本,但没有实际文本。一些复印机在使用包含许多错误的质量非常低的 OCR 时生成“可搜索的 PDF”,但不一定在通常是某种带有大字体的标题页的第一页上,因此算法遇到的文本的第一行似乎高质量。或者第一页可能有文本而其他页面没有,但算法可能会认为整个 PDF 有文本。

在我们基于服务器的商用大容量 OCR 软件(由服务机构、SaaS 平台、图书馆、积压转换等使用)中,我们现在可以使用现有的文本层和“智能决策”对 PDF 进行高级检测,可以过滤许多这些误报情况。我们的 OCR 可以跳过 PDF 中具有高质量文本的重新 OCRing PDF。如果您正在寻找一个优质廉价的 OCR 平台,这种检测是其中的一个功能,但如果没有我们的 OCR,它就无法单独使用。 OCR 工作流程用作该过滤器的一部分。我们的开发人员无需外部工具即可编写和集成这些算法。

我在www.wisetrend.com 工作,我们为各种 OCR 项目提供软件解决方案和咨询。

【讨论】:

  • 不,这不是我想要的。我想在 pdf 上“绘制”已识别的文本。
  • 绘制已识别的文本?我又不清楚了。您是否在询问如何将文本图层添加到图像 PDF 中导致“图像上的文本”(您看到矢量文本)或“图像下的文本”(您看到图像但文本存在于图像坐标下)类型的 PDF?在任何情况下,任何 PDF SDK 都可以添加或编辑文本层:forums.adobe.com/thread/928424
猜你喜欢
  • 2013-09-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2019-03-04
  • 1970-01-01
  • 2015-05-06
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多