【问题标题】:Extract phrases from PDFs with Deep Learning使用深度学习从 PDF 中提取短语
【发布时间】:2020-01-10 23:54:25
【问题描述】:

我想教 AI 从 PDF 中提取特定短语。 例如,产品名称在文档中的某个地方进行了描述,人工智能必须找到并提取它。 我的问题是,如果将 PDF 作为图像或提取的字符串提供更好,因为文档的结构很粗略。 我希望我的问题可以理解。

也许有人对我也有一些想法或关键词:)

编辑: 感谢 lsimmons 的提示,我找到了一种方法: https://appliedmachinelearning.blog/2019/04/01/training-deep-learning-based-named-entity-recognition-from-scratch-disease-extraction-hackathon/

我会试试这个代码,当然只是使用产品名称而不是疾病。 这被称为“命名实体识别”,适用于遇到相同问题的每个人。 我希望这行得通。

【问题讨论】:

    标签: keras deep-learning


    【解决方案1】:

    将 pdf 图像中的字符转换为文本更像是一项计算机视觉任务,而且这似乎不是您想要做的,因为您似乎对短语提取(即 NLP)更感兴趣。因此,第一步可能是在将文本输入 NLP 库进行短语提取之前从 pdf 中提取文本。

    在 Python 中似乎有很多库可以进行 pdf 文本提取 - this 从 Google 快速搜索中弹出。至于 NLP,在这个领域有很多库和概念需要学习,再次快速谷歌搜索得到 this 文章作为 Python 中 NLP 的介绍。

    【讨论】:

    • “短语提取”是否适合我的计划?还是有更好的关键字?
    • @Helyon 不完全确定大多数人会称之为从文本中提取产品名称 - 在我看来,“实体提取”可能是一个更好的术语。
    猜你喜欢
    • 2016-12-31
    • 2016-09-02
    • 2018-08-13
    • 1970-01-01
    • 2018-11-05
    • 1970-01-01
    • 2021-02-25
    • 2020-06-30
    • 1970-01-01
    相关资源
    最近更新 更多