【问题标题】:Want to configure tika parsing to do OCR on PDFs only想要将 tika 解析配置为仅对 PDF 进行 OCR
【发布时间】:2020-08-27 02:49:17
【问题描述】:

我正在尝试操作 tika 配置文件(使用 tika 服务器)以从 OCR 处理中排除除 PDF 之外的所有文档。我尝试了许多组合,例如从默认解析器中排除 OCR,但将 PDF 解析器配置为进行内联处理。我尝试配置自动策略。我从默认解析器中排除了 PDF 和 Tesseract。没有运气。我最终运行了两个 tika 实例,一个配置了 OCR,一个没有配置 OCR,并根据扩展名将文件定向到我的代码中的一个或另一个。我正在使用 python tika 客户端。有没有更好的办法?更一般地说,是否有在 tika 中配置解析器参数的综合指南?我所看到的大部分都是零碎的。谢谢。

【问题讨论】:

标签: pdf ocr apache-tika


【解决方案1】:

你知道ocrStrategy吗?

pdfParserConfig.setOcrStrategy(ocrStrategy)

ocrStrategy 是一个枚举 - OCRStrategy

您可以为 pdf 设置值 OCR_ONLY 和其他文档的 NO_OCR

【讨论】:

  • 感谢您的参考。我了解如何在 Java 领域做到这一点。我正在使用 python,并依赖于 tika 配置文件的内容。我找不到显示该文件和 java 配置设置之间映射的文档 - 不确定是否存在这样的映射。
  • 我不知道你是如何在 python 中做到这一点的,但我可以推荐 TikaOCR 作为 docker 图像开始 - 我希望它对你有用。 Tika 公开了其余的 api,然后您可以使用它并且它与语言无关。查看解释其工作原理的博客文章:medium.com/@masreis/… 对扫描的 pdf 进行 ocr 的示例命令是: curl -H "X-Tika-PDFextractInlineImages: true" -H "X-Tika-PDFocrStrategy: OCR_ONLY" -T test.pdf localhost:9998/tika
猜你喜欢
  • 2022-11-10
  • 1970-01-01
  • 2017-09-09
  • 2023-03-12
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-10-21
  • 1970-01-01
相关资源
最近更新 更多