【发布时间】:2021-01-14 00:38:45
【问题描述】:
我创建了一个人工语料库(包含 52624 个文档)。每个文档都是一个对象列表(其中有 461 个)。
所以一种可能是:['chair', 'chair', 'chair', 'chair', 'chair', 'table', 'table']
这是词汇表的条形图(对数刻度)。
这就是我定义模型的方式:
model = gensim.models.doc2vec.Doc2Vec(vector_size=8, workers=4, min_count=1,epochs=40, dm=0)
观察地点:
model.wv.most_similar_cosmul(positive = ["chair"])
我看到不相关的词
在我看来,以下工作也很糟糕:
inferred_vector = model.infer_vector(["chair"])
model.docvecs.most_similar([inferred_vector])
我的模型哪里失败了?
更新
有数据(JSON文件):
【问题讨论】:
标签: machine-learning nlp gensim word2vec doc2vec