【发布时间】:2021-07-08 21:58:11
【问题描述】:
我对 Word2Vec 完全陌生。我想在我的数据中找到单词对之间的余弦相似度。我的代码如下:
import pandas as pd
from gensim.models import Word2Vec
model = Word2Vec(corpus_file="corpus.txt", sg=0, window =7, size=100, min_count=10, iter=4)
vocabulary = list(model.wv.vocab)
data=pd.read_csv("experiment.csv")
cos_similarity = model.wv.similarity(data['word 1'], data['word 2'])
问题是我的“experiment.csv”文件的数据列中的一些单词:语料库文件(“corpus.txt”)中不存在“word 1”和“word 2”。所以返回这个错误:
"word 'setosa' not in vocabulary"
我应该如何处理输入语料库中不存在的单词?我想在我的实验中将输入语料库中不存在的单词分配为零向量,但我被困在如何做到这一点。
对我的问题有什么想法吗?
【问题讨论】: