【发布时间】:2018-07-19 11:16:36
【问题描述】:
我正在使用 tesseract-ocr 并以 hOCR 格式获取输出。我需要将此 hOCR 输出存储到数据库中(在我的例子中是 PostgreSQL)。
由于我可能需要单独来自此 hOCR 的每条信息(其中 80%),哪种方法是正确的?它应该存储为 XML 数据类型还是解析为 JSON 并存储?如果是 JSON,如何使用 Python 将此 hOCR 解析为 JSON。也欢迎其他相关建议。
【问题讨论】:
-
你之前自己尝试过什么?
-
我仍然需要为此设计数据库,我目前正在决定工作流程和要包含在此工作流程中的元素,以存储此 hOCR 格式文件的详细信息。我不是python程序员。所以,还没有尝试实现。
标签: python postgresql parsing python-tesseract hocr