【问题标题】:Conversion of PDF to XML using Machine Learning [closed]使用机器学习将 PDF 转换为 XML [关闭]
【发布时间】:2020-01-10 09:38:32
【问题描述】:

我得到了一项将 PDF 转换为 XML 的工作。在 XML 中,我必须显示一些 PDF 格式的值。 我被要求使用 Python-3 和机器学习来提取值。

关于如何创建 ML 模型以从 PFD 中提取信息的任何建议或想法。

问题详解: 如果我有一个具有值的 pdf,例如:

员工编号:10000 名称:拉姆

然后我必须从 PDF 中提取 empid 和 name 并将它们显示到 XML 文档中。

注意:该模型应该能够处理数千个 PDF 并将它们转换为 XML 文档。

谢谢你...

【问题讨论】:

  • 嗨 - 您需要澄清很多问题 - 首先,PDF 是扫描的(文档图像)还是基于文本的?如果基于文本,您需要开始解析您的 pdf,如果您被要求提供 ML 解决方案,我认为它有图像。在这里,您首先需要使用 opencv 或 pytesseract 等工具对文档中的 OCR(识别字符)和 ROI(感兴趣区域),然后使用 FUNSD 等预注释数据集,训练系统识别问题和答案或内部的类似实体你的文件。

标签: python machine-learning deep-learning computer-vision data-science


【解决方案1】:

有一个 API 可用于将 PDF 转换为 Excel (.xlsx)、XML 或 CSV:PDFTables。如果这对您有帮助,请告诉我们。

【讨论】:

  • «我被要求使用 Python-3 和机器学习来提取值。
  • 机器学习是一个广义的术语。使用 ML 从 PDF 中提取值的具体含义是什么?
猜你喜欢
  • 2017-12-25
  • 2011-02-24
  • 1970-01-01
  • 2017-11-08
  • 2013-02-04
  • 2011-06-16
  • 2018-11-16
  • 1970-01-01
相关资源
最近更新 更多