【问题标题】:Can doc2vec be useful if training on Documents and inferring on sentences only如果仅对文档进行培训并仅推断句子,则 doc2vec 是否有用
【发布时间】:2018-06-05 05:38:40
【问题描述】:
我正在使用 gensim 的 Doc2vec 对一些文档进行培训。
我有两种类型的输入:
- 全英文维基百科:维基百科文本的每篇文章都被视为一个
doc2vec 培训文档。 (总计约 550 万篇文章或文件)
- 与我的项目相关的一些文档是手动准备和从一些网站收集的。 (大约 15000 个文档)。
每个文档的大小约为 100 句。
此外,我想用这个模型来推断句子的大小(10~20 个单词)。
我要求澄清我的方法。
对文档进行训练(每个文档的大小约为 100 个句子)然后推断新句子的方法是否正确。 ?
或者,我应该只训练句子而不是文档,然后推断新句子吗?
【问题讨论】:
标签:
python
gensim
training-data
doc2vec
【解决方案1】:
每个语料库和项目目标都不同。您对较大文档进行训练然后推断较短句子的方法似乎可行,但是您必须尝试它以查看效果如何,然后反复测试较短的训练文档(作为单个句子或句子组)是否效果更好,针对您的特定目标。
请注意,gensimDoc2Vec 推理通常从非默认参数中获益——尤其是更多 steps(比微小的默认值 5)或更小的起始 alpha(更像是训练默认值 0.025) ,尤其是较短的文档。而且,根据原始模型元参数,这种推断也可能会更好或更差。
另请注意,实施限制意味着在gensim Word2Vec/Doc2Vec 训练中,超过 10,000 个标记的文本会被静默截断。 (如果您有更长的文档,您可以将它们拆分为少于 10K 令牌的子文档,然后为每个子文档重复 tags,以密切模拟使用更长的文档进行训练的效果。)