【问题标题】:How to bind Tika python with Tesseract OCR?如何将 Tika python 与 Tesseract OCR 绑定?
【发布时间】:2017-04-27 08:28:51
【问题描述】:

当我在终端中调用它时,它工作得很好!

tesseract 1.jpg outPutFileHere -l fra

但我正在尝试让它与 tika 一起使用

import tika
import sys
from tika import parser
from tika import detector
tikedDocument = parser.from_file(TextImage)

使用相同的文本图像,我对 tika 没有结果 :(

你知道发生了什么吗?

谢谢

【问题讨论】:

  • 你能格式化你的代码吗?
  • 你关注wiki.apache.org/tika/TikaOCR了吗?
  • 是的!我已经测试过遵循 apache tika 简短教程,他们只是说要安装 tesseract 然后 tika 和......就是这样!我通过子进程调用它并通过文件等获取返回值来重新编码 tesseract 函数......但这不是我首先想要的!蒂卡应该这样做!
  • @john doe 是的!只需使用 tika 进行脚本 python 调用,如果从子进程中您可以通过 stdout 捕获错误和警告,并在 tika 无法从 pdf 中获取数据时使用 tesseract。

标签: python apache ocr tesseract apache-tika


【解决方案1】:

您需要提供名为“X-Tika-OCRlanguage”的标题,例如:

headers = {
    "X-Tika-OCRLanguage": "eng+nor"
}
parsed = parser.from_file(path, headers=headers)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2018-02-25
    • 1970-01-01
    • 2016-03-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多