【问题标题】:Should the vocabulary be restricted to the training-set vocabulary when training an NN model with pretrained word2vec like GLOVE?在使用 GLOVE 之类的预训练 word2vec 训练 NN 模型时,是否应该将词汇限制为训练集词汇?
【发布时间】:2020-01-01 06:45:36
【问题描述】:

我想使用来自 GLOVE 的预训练向量,在我的神经网络中使用词嵌入作为嵌入层。在构建 word2index 字典时,我是否需要将词汇限制在训练集中? 这不会导致有限的不可泛化模型吗? 考虑 GLOVE 的所有词汇是推荐的做法吗?

【问题讨论】:

    标签: keras neural-network word-embedding glove


    【解决方案1】:

    是的,最好限制你的词汇量。因为预训练的嵌入(如 GLOVE)中有许多不是很有用的单词(Word2Vec 也是如此),而且词汇量越大,您需要的 RAM 越多以及其他问题。

    从您的所有数据中选择您的令牌。如果您的数据足够大,它不会导致有限的不可泛化模型。如果你认为你的数据没有足够多的令牌,那么你应该知道两件事:

    1. 您的数据不够好,您必须收集更多。
    2. 您的模型无法很好地生成在训练时未见过的标记!因此,在您的嵌入中包含许多未使用的单词是没有意义的,最好收集更多数据来覆盖这些单词。

    我有一个答案来说明如何从预训练模型in here 中选择少量词向量

    【讨论】:

      猜你喜欢
      • 2019-01-16
      • 1970-01-01
      • 2018-02-04
      • 1970-01-01
      • 2019-09-25
      • 2016-06-11
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多