【发布时间】:2021-04-08 11:41:54
【问题描述】:
通过method
gensim.models.Word2Vec.most_similar
我得到前 N 个最相似的词。
我用一系列句子训练了一个模型,例如
list_of_list = [["i like going to the beach"],
["the war is over"],
["we are all made of stars"],
...
["i don't know what to do"]]
model = gensim.models.Word2Vec(list_of_list, size=100, window=longest_list, min_count=2)
suggestions = model.most_similar("I don't know what to do", topn=10)
我想评估短语的相似性。
例如,如果我运行
suggestions = model.most_similar("I don't know what to do", topn=10)
它工作正常。
但是,如果我给出像 "to the beach" 或 "what to do" 这样的子查询,它会返回错误消息,因为子短语不在词汇表中。
"word 'to the beach' not in vocabulary"
如何在不再次训练模型的情况下解决此问题? 模型如何根据新短语而不是副短语来识别最相似的短语?
【问题讨论】:
标签: python nlp gensim similarity