【发布时间】:2021-04-14 17:37:56
【问题描述】:
我运行以下代码,只是想知道为什么“曝光”的前 3 个最相似的词不包括“充电”和“借出”?
from gensim.models import Word2Vec
corpus = [['total', 'exposure', 'charge', 'lend'],
['customer', 'paydown', 'rate', 'months', 'month']]
gens_mod = Word2Vec(corpus, min_count=1, vector_size=300, window=2, sg=1, workers=1, seed=1)
keyword="exposure"
gens_mod.wv.most_similar(keyword)
Output:
[('customer', 0.12233059108257294),
('month', 0.008674687705934048),
('total', -0.011738087050616741),
('rate', -0.03600010275840759),
('months', -0.04291829466819763),
('paydown', -0.044823747128248215),
('lend', -0.05356598272919655),
('charge', -0.07367636263370514)]
【问题讨论】:
标签: python nlp gensim word2vec word-embedding