【问题标题】:Can doc2vec be useful if training on Documents and inferring on sentences only如果仅对文档进行培训并仅推断句子,则 doc2vec 是否有用
【发布时间】:2018-06-05 05:38:40
【问题描述】:

我正在使用 gensim 的 Doc2vec 对一些文档进行培训。

我有两种类型的输入:

  1. 全英文维基百科:维基百科文本的每篇文章都被视为一个 doc2vec 培训文档。 (总计约 550 万篇文章或文件)
  2. 与我的项目相关的一些文档是手动准备和从一些网站收集的。 (大约 15000 个文档)。
    每个文档的大小约为 100 句。

此外,我想用这个模型来推断句子的大小(10~20 个单词)。

我要求澄清我的方法。
对文档进行训练(每个文档的大小约为 100 个句子)然后推断新句子的方法是否正确。 ?

或者,我应该只训练句子而不是文档,然后推断新句子吗?

【问题讨论】:

    标签: python gensim training-data doc2vec


    【解决方案1】:

    每个语料库和项目目标都不同。您对较大文档进行训练然后推断较短句子的方法似乎可行,但是您必须尝试它以查看效果如何,然后反复测试较短的训练文档(作为单个句子或句子组)是否效果更好,针对您的特定目标。

    请注意,gensimDoc2Vec 推理通常从非默认参数中获益——尤其是更多 steps(比微小的默认值 5)或更小的起始 alpha(更像是训练默认值 0.025) ,尤其是较短的文档。而且,根据原始模型元参数,这种推断也可能会更好或更差。

    另请注意,实施限制意味着在gensim Word2Vec/Doc2Vec 训练中,超过 10,000 个标记的文本会被静默截断。 (如果您有更长的文档,您可以将它们拆分为少于 10K 令牌的子文档,然后为每个子文档重复 tags,以密切模拟使用更长的文档进行训练的效果。)

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-07-17
      • 2019-04-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多