【发布时间】:2020-01-10 09:38:32
【问题描述】:
我得到了一项将 PDF 转换为 XML 的工作。在 XML 中,我必须显示一些 PDF 格式的值。 我被要求使用 Python-3 和机器学习来提取值。
关于如何创建 ML 模型以从 PFD 中提取信息的任何建议或想法。
问题详解: 如果我有一个具有值的 pdf,例如:
员工编号:10000 名称:拉姆
然后我必须从 PDF 中提取 empid 和 name 并将它们显示到 XML 文档中。
注意:该模型应该能够处理数千个 PDF 并将它们转换为 XML 文档。
谢谢你...
【问题讨论】:
-
嗨 - 您需要澄清很多问题 - 首先,PDF 是扫描的(文档图像)还是基于文本的?如果基于文本,您需要开始解析您的 pdf,如果您被要求提供 ML 解决方案,我认为它有图像。在这里,您首先需要使用 opencv 或 pytesseract 等工具对文档中的 OCR(识别字符)和 ROI(感兴趣区域),然后使用 FUNSD 等预注释数据集,训练系统识别问题和答案或内部的类似实体你的文件。
标签: python machine-learning deep-learning computer-vision data-science