【问题标题】:Document classification using machine learning使用机器学习进行文档分类
【发布时间】:2020-05-29 03:04:55
【问题描述】:

我目前正在处理一个项目,我需要能够对传入的文档进行动态分类。这些文档可以是文本 PDF 文件,也可以是扫描的 PDF 文件。

我有以下标签:

  • 发票
  • 装箱单
  • 证书

我试图弄清楚我应该如何解决这个问题。

我最初的想法

我认为解决此问题的最佳方法是根据文档文本执行文本分类。

第 1 步 - 训练模型

  • 首先将 PDF 文件转换为文本。
  • 然后用三个标签之一标记文本内容。 (对大型数据集执行此操作)

第 2 步 - 使用模型

  • 训练模型后,对于新传入的文档,将其转换为文本。
  • 通过模型运行文本内容,得到文本分类。

还有其他方法可以做到这一点吗?我担心的是我不确定您是否可以对整个文本文档执行 NLP?也许需要对象检测(计算机视觉)?

【问题讨论】:

  • 为什么要训练自己的模型?
  • @Ahmet 我想我不知道?我在想我收到了很多以前可能看不到的不同供应商文件——我不知道有什么其他模型可以做到这一点?
  • 经典检索技术怎么样? TF-IDF?
  • 如果不行的话试试文字分类添加图片

标签: python machine-learning nlp computer-vision


【解决方案1】:

我了解您的问题。 关于它的一些关键点 a) 首先对输入数据进行预处理。即(例如,发票或 pdf 证书中有多少页)。然后,将 pdf 转换为 TiFF 图像。

b) 使用图像、视觉\布局和文本的训练模型。你会得到很好的准确性。 c) 你可以使用计算机视觉和深度学习(Keras 和 tensorflow)

【讨论】:

    【解决方案2】:

    计算机视觉会更快,是您用例中的首选。从布局的角度来看,这三种类型的文档在视觉上是否有所不同?证书可能具有不同的“外观”和“布局”,但装箱单和发票可能看起来相似。您可能希望将 PDF 转换为页面图像并首先训练和运行图像分类模型。您应该在像 ResNet 这样的预训练图像分类模型上使用迁移学习。

    您可以对“整个文档”执行 NLP,但它最适用于散文文本,而不是发票或装箱单上的文本。您可以查找实际上可用于分类整页文本而不仅仅是句子的句子嵌入模型(Infersent、Google USE、BERT)。尽管其中一些可能在计算上很昂贵。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-08-15
      • 2018-03-05
      • 2018-03-04
      • 2019-01-27
      • 2017-06-11
      • 1970-01-01
      • 2017-06-07
      • 1970-01-01
      相关资源
      最近更新 更多