【发布时间】:2018-07-19 17:42:22
【问题描述】:
我有一组预训练的 word2vec 词向量和一个语料库。我想用词向量来表示语料库中的词。语料库中有一些我没有训练过的词向量的词。处理那些没有预训练向量的单词的最佳方法是什么?
我听到了一些建议。
对每个缺失的单词使用零向量
为每个缺失的单词使用一个随机数向量(提供一堆关于如何限制这些随机数的建议)
我的一个想法:从所有预训练的向量中获取一个向量,其值是该位置所有值的平均值
任何对此问题有经验的人有想法如何处理这个问题?
【问题讨论】:
标签: machine-learning nlp deep-learning word2vec word-embedding