【发布时间】:2020-05-22 07:36:38
【问题描述】:
我正在使用 Apache Tika 解析文档并生成文档的纯文本版本和 HTML 预览。如果我调用parse 函数两次并传入两个单独的ContentHandlers,我能够生成两者都很好——这对于纯文本文档非常有用。但是当我得到需要使用 tesseract 进行 OCR 的文档时,这就有点问题了——调用 parse 函数两次是非常浪费的,因为它同时执行了两次 OCR(可能需要一分钟左右)。
我知道我可以编写自己的 ContentHandler,但只是想知道是否有人知道为此提供开箱即用的解决方案?非常感谢!
【问题讨论】:
标签: java tesseract apache-tika