【发布时间】:2019-05-16 22:35:37
【问题描述】:
假设您有一个(维基百科)预训练的 word2vec 模型,并在一个额外的语料库(非常小,1000 个香味)上对其进行训练。
你能想出一种方法将向量搜索限制在“重新训练”的语料库中吗?
例如
model.wv.similar_by_vector()
将简单地为给定向量找到最接近的词,无论它是维基百科语料库的一部分,还是重新训练的词汇表。
另一方面,对于“单词”搜索,存在这个概念:
most_similar_to_given('house',['garden','boat'])
我尝试从头开始基于小型语料库进行训练,它在某种程度上按预期工作。但是,如果分配的向量来自预先训练的集合,当然会更强大。
【问题讨论】: