【问题标题】:Methods to extract keywords from large documents that are relevant to a set of predefined guidelines using NLP/ Semantic Similarity使用 NLP/语义相似度从与一组预定义指南相关的大型文档中提取关键字的方法
【发布时间】:2019-03-02 07:58:36
【问题描述】:

我需要有关如何从大型文档中提取关键字的建议。关键字应该是我们定义为预期搜索结果的内联关键字。

例如,

我需要所有者的姓名、办公室所在的位置、提供有关公司的文件时的经营行业是什么,以及定义的一组词是,

{所有者、主管、办公室、行业...}-(1)

预期的输出必须类似于,

{Mr.Smith James, , Main Street, Financial Banking}-(2)

我正在寻找一种与语义相似性相关的方法,其中将提取包含与给定语料库 (1) 相似的单词的句子,并使用 POS 标记从这些句子中提取名词。

如果可以提供支持这种方法的更多资源,那将是有用的。

【问题讨论】:

    标签: python nlp semantics similarity wordnet


    【解决方案1】:

    您要执行的操作称为Named Entity Recognition

    在 Python 中有一个名为 SpaCy 的流行库可以用于此目的。标准模型能够检测到18 different entity types,这是一个相当不错的数量。

    个人和公司名称应该很容易提取,而整个地址和行业可能更难提取。也许您必须在这些实体类型上训练自己的模型。 SpaCy 还提供了一个 API 用于训练您自己的模型。 请注意,您需要大量的训练数据才能获得不错的结果。从每个实体类型 1000 个示例开始,看看它是否足以满足您的需求。 POS 可以作为一项功能使用。

    如果您的数据是非结构化的,这可能是最适合的方法之一。如果您有更多结构化数据,您也许可以利用这一点。

    【讨论】:

    • 非常感谢您的回复。这很有帮助,它确实有助于回答我的问题。
    猜你喜欢
    • 2021-09-05
    • 2017-10-16
    • 2021-03-14
    • 1970-01-01
    • 2023-03-24
    • 1970-01-01
    • 1970-01-01
    • 2017-07-24
    • 2021-04-04
    相关资源
    最近更新 更多