【问题标题】:Is there pre-trained doc2vec model?是否有预训练的 doc2vec 模型?
【发布时间】:2018-12-10 11:38:53
【问题描述】:

是否存在具有大型数据集的预训练 doc2vec 模型,如 Wikipedia 或类似网站?

【问题讨论】:

    标签: gensim doc2vec


    【解决方案1】:

    是的! 我可以在 link 找到两个预训练的 doc2vec 模型

    但仍然找不到任何经过推文训练的预训练 doc2vec 模型

    【讨论】:

      【解决方案2】:

      我不知道有什么好的。 this project 有一个链接,但是:

      • 它基于来自旧 gensim 的自定义分支,因此不会在最近的代码中加载
      • 尚不清楚它是使用哪些参数或数据进行训练的,相关论文可能对参数的影响做出了不知情的选择
      • 包含 Wikipedia 文章(超过 400 万)或文章段落(数千万)的实际文档向量或大量词向量的大小似乎不合适,所以不清楚什么被丢弃了

      虽然这需要很长时间和大量的工作 RAM,但有一个 Jupyter 笔记本演示了创建来自 Wikipedia 的 Doc2Vec 模型,该模型包含在 gensim 中:

      https://github.com/RaRe-Technologies/gensim/blob/develop/docs/notebooks/doc2vec-wikipedia.ipynb

      因此,我建议您修正尝试中的错误。 (而且,如果您成功创建了一个模型,并想为其他人记录它,您可以将它上传到某个地方以供其他人重复使用。)

      【讨论】:

      • 我知道这是一个非常古老的答案,但您认为可以在 Google colab 上训练 Doc2Vec 模型吗?
      • 我不是 Google Colab 的用户,但如果我理解正确的话,它可以让您在笔记本中运行 Python 代码,并且有足够的 RAM 来执行常见的 ML 任务 - 为什么不呢?跨度>
      猜你喜欢
      • 2017-06-26
      • 2018-07-31
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-11-21
      • 2016-08-17
      • 2017-08-19
      相关资源
      最近更新 更多