【发布时间】:2019-04-29 22:10:11
【问题描述】:
我正在使用以下python代码生成词向量的相似度矩阵(我的词汇量是77)。
similarity_matrix = []
index = gensim.similarities.MatrixSimilarity(gensim.matutils.Dense2Corpus(model.wv.syn0))
for sims in index:
similarity_matrix.append(sims)
similarity_array = np.array(similarity_matrix)
similarity_array 的维度是300 X 300。但是,据我了解,维度应该是77 x 77(因为我的词汇量是 77)。
i.e.,
word1, word2, ......, word77
word1 0.2, 0.8, ..., 0.9
word2 0.1, 0.2, ...., 1.0
... ...., ....., ....., ....
word77 0.9, 0.8, ..., 0.1
请让我知道我的代码有什么问题。
另外,我想知道用于计算这个相似度矩阵的词汇(word1, word2, ..., word77)的顺序是什么?我可以从model.wv.index2word 获得这个order 吗?
请帮帮我!
【问题讨论】:
标签: python word2vec gensim word-embedding