【发布时间】:2017-04-27 08:28:51
【问题描述】:
当我在终端中调用它时,它工作得很好!
tesseract 1.jpg outPutFileHere -l fra
但我正在尝试让它与 tika 一起使用
import tika
import sys
from tika import parser
from tika import detector
tikedDocument = parser.from_file(TextImage)
使用相同的文本图像,我对 tika 没有结果 :(
你知道发生了什么吗?
谢谢
【问题讨论】:
-
你能格式化你的代码吗?
-
是的!我已经测试过遵循 apache tika 简短教程,他们只是说要安装 tesseract 然后 tika 和......就是这样!我通过子进程调用它并通过文件等获取返回值来重新编码 tesseract 函数......但这不是我首先想要的!蒂卡应该这样做!
-
@john doe 是的!只需使用 tika 进行脚本 python 调用,如果从子进程中您可以通过 stdout 捕获错误和警告,并在 tika 无法从 pdf 中获取数据时使用 tesseract。
标签: python apache ocr tesseract apache-tika