【发布时间】:2021-09-14 10:24:50
【问题描述】:
我有一个包含大约 280 万条文本的数据库(更准确地说是推文,所以它们是短文本)。我将干净的推文(删除主题标签、标签、停用词......)放在名为sentences 的标记列表中(因此它包含每条推文的标记列表)。
经过这些步骤,如果我写了
model = Word2Vec(sentences, min_count=1)
我获得了大约 400,000 个单词的词汇。
这只是一个尝试,我需要一些帮助才能以最合适和一致的方式设置Word2Vec 的参数(size、window、min_count、workers、sg) .
考虑到我的目标是使用
model.most_similar(terms)(其中terms 是单词列表)
在标记列表sentences 中查找与terms 中包含的单词最相似的单词。
terms 中的词属于同一主题,我想看看文中是否还有其他与主题有关的词。
【问题讨论】:
标签: python nlp gensim word2vec word-embedding