【发布时间】:2020-05-29 03:04:55
【问题描述】:
我目前正在处理一个项目,我需要能够对传入的文档进行动态分类。这些文档可以是文本 PDF 文件,也可以是扫描的 PDF 文件。
我有以下标签:
- 发票
- 装箱单
- 证书
我试图弄清楚我应该如何解决这个问题。
我最初的想法
我认为解决此问题的最佳方法是根据文档文本执行文本分类。
第 1 步 - 训练模型
- 首先将 PDF 文件转换为文本。
- 然后用三个标签之一标记文本内容。 (对大型数据集执行此操作)
第 2 步 - 使用模型
- 训练模型后,对于新传入的文档,将其转换为文本。
- 通过模型运行文本内容,得到文本分类。
还有其他方法可以做到这一点吗?我担心的是我不确定您是否可以对整个文本文档执行 NLP?也许需要对象检测(计算机视觉)?
【问题讨论】:
-
为什么要训练自己的模型?
-
@Ahmet 我想我不知道?我在想我收到了很多以前可能看不到的不同供应商文件——我不知道有什么其他模型可以做到这一点?
-
经典检索技术怎么样? TF-IDF?
-
如果不行的话试试文字分类添加图片
标签: python machine-learning nlp computer-vision