【发布时间】:2019-08-08 17:12:27
【问题描述】:
基本上我想知道一个特定的句子/文档与我的训练语料库有多相似。
我想我可能对如何处理这个问题有一半的想法,但我不太确定。 所以我的想法是计算文档的平均向量,然后以某种方式计算相似度。我只是不知道我将如何计算相似度。
假设我有一个包含关于狗的文本的训练语料库。然后,如果我想检查“飞机有 100 个座位”这句话与我想要的训练语料库的相似度有多高。
【问题讨论】:
标签: nlp word2vec similarity
基本上我想知道一个特定的句子/文档与我的训练语料库有多相似。
我想我可能对如何处理这个问题有一半的想法,但我不太确定。 所以我的想法是计算文档的平均向量,然后以某种方式计算相似度。我只是不知道我将如何计算相似度。
假设我有一个包含关于狗的文本的训练语料库。然后,如果我想检查“飞机有 100 个座位”这句话与我想要的训练语料库的相似度有多高。
【问题讨论】:
标签: nlp word2vec similarity
这是一个语义文本相似性问题。您可以在这里查看最先进的模型https://nlpprogress.com/english/semantic_textual_similarity.html
通常,您会将文档传递到编码器中以创建表示(文档的嵌入),然后对句子执行相同操作(通常使用相同的编码器)。这些向量可以被送入更多的层以进行进一步的处理。然后可以在向量(嵌入)上使用余弦等相似性度量,或者可以使用联合最终表示进行分类。
您可以在编码步骤中使用一些预训练的语言模型,并针对您的用例对其进行微调。
【讨论】: