【问题标题】:What is the best way to handle missing words when using word embeddings?使用词嵌入时处理缺失词的最佳方法是什么?
【发布时间】:2018-07-19 17:42:22
【问题描述】:

我有一组预训练的 word2vec 词向量和一个语料库。我想用词向量来表示语料库中的词。语料库中有一些我没有训练过的词向量的词。处理那些没有预训练向量的单词的最佳方法是什么?

我听到了一些建议。

  1. 对每个缺失的单词使用零向量

  2. 为每个缺失的单词使用一个随机数向量(提供一堆关于如何限制这些随机数的建议)

  3. 我的一个想法:从所有预训练的向量中获取一个向量,其值是该位置所有值的平均值

任何对此问题有经验的人有想法如何处理这个问题?

【问题讨论】:

    标签: machine-learning nlp deep-learning word2vec word-embedding


    【解决方案1】:

    Facebook 的 FastText 从子词 n-gram 中组装词向量,使其能够处理词汇表之外的词。在以下位置查看有关此方法的更多信息:Out of Vocab Word Embedding

    【讨论】:

    • 您是否知道任何有关如何在将权重传递给嵌入矩阵时使用 fasttext 创建缺少词汇的向量的 Python 代码教程。在上面找不到任何东西。
    【解决方案2】:

    在预训练的word2vec 嵌入矩阵中,您通常可以使用单词unk 作为索引来查找通常是最佳向量的预设计向量。

    【讨论】:

      猜你喜欢
      • 2019-05-11
      • 2020-04-30
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-08-21
      • 2010-09-06
      • 2021-11-18
      相关资源
      最近更新 更多