【发布时间】:2020-08-27 02:49:17
【问题描述】:
我正在尝试操作 tika 配置文件(使用 tika 服务器)以从 OCR 处理中排除除 PDF 之外的所有文档。我尝试了许多组合,例如从默认解析器中排除 OCR,但将 PDF 解析器配置为进行内联处理。我尝试配置自动策略。我从默认解析器中排除了 PDF 和 Tesseract。没有运气。我最终运行了两个 tika 实例,一个配置了 OCR,一个没有配置 OCR,并根据扩展名将文件定向到我的代码中的一个或另一个。我正在使用 python tika 客户端。有没有更好的办法?更一般地说,是否有在 tika 中配置解析器参数的综合指南?我所看到的大部分都是零碎的。谢谢。
【问题讨论】:
-
欢迎来到 Stack Overflow!请使用tour 并通读help center,尤其是how to ask。你最好的选择是做你的研究,搜索关于 SO 的相关主题,然后试一试。在进行更多研究和搜索后,发布您的尝试Minimal, Complete, and Verifiable example,并具体说明您遇到的问题,这可以帮助您获得更好的答案。
标签: pdf ocr apache-tika