【问题标题】:Sentence similarity using word2vev使用 word2vev 的句子相似度
【发布时间】:2019-08-08 17:12:27
【问题描述】:

基本上我想知道一个特定的句子/文档与我的训练语料库有多相似。

我想我可能对如何处理这个问题有一半的想法,但我不太确定。 所以我的想法是计算文档的平均向量,然后以某种方式计算相似度。我只是不知道我将如何计算相似度。

假设我有一个包含关于狗的文本的训练语料库。然后,如果我想检查“飞机有 100 个座位”这句话与我想要的训练语料库的相似度有多高。

【问题讨论】:

    标签: nlp word2vec similarity


    【解决方案1】:

    这是一个语义文本相似性问题。您可以在这里查看最先进的模型https://nlpprogress.com/english/semantic_textual_similarity.html

    通常,您会将文档传递到编码器中以创建表示(文档的嵌入),然后对句子执行相同操作(通常使用相同的编码器)。这些向量可以被送入更多的层以进行进一步的处理。然后可以在向量(嵌入)上使用余弦等相似性度量,或者可以使用联合最终表示进行分类。

    您可以在编码步骤中使用一些预训练的语言模型,并针对您的用例对其进行微调。

    【讨论】:

    • 我可以为 LDA 做类似的事情吗?还是那是不同的球类游戏?
    猜你喜欢
    • 2017-01-10
    • 2020-12-27
    • 2015-07-04
    • 2017-05-28
    • 1970-01-01
    • 2015-03-25
    • 1970-01-01
    • 2011-06-05
    • 2016-07-10
    相关资源
    最近更新 更多