【问题标题】:Is Word2Vec itself a discriminative model or a generative model?Word2Vec 本身是判别模型还是生成模型?
【发布时间】:2019-09-17 05:20:35
【问题描述】:

我想知道 Word2Vec 本身是判别模型还是生成模型?

CBOW 和 Skip-gram 都旨在最大化与令牌及其上下文之间的条件概率相对应的似然函数。只关注网络和训练过程,我想它遵循一种区分方法。

然而,词嵌入是一种副产品,它描述了训练语料库中标记之间的关系。考虑使用分段语料库训练的 Word2Vec 模型,接收一个标记并输出其嵌入,我们经常说“它生成一个词嵌入”。 Word2Vec 模型是判别模型还是生成模型?

我在制定它时遇到了一些麻烦。

【问题讨论】:

    标签: machine-learning nlp statistics data-science word2vec


    【解决方案1】:

    生成模型和判别模型之间的主要区别在于,生成模型描述其输入和输出的联合分布,而判别模型描述给定输入的输出的条件分布

    Word2Vec 因此有区别地训练:在 CBOW 中,我们根据上下文预测一个单词,skip-gram 模型则相反。

    当您说它生成嵌入时,它是“生成”的不同含义,它并不意味着从联合分布中采样,而是一般地生成。

    我的观点是,一旦嵌入训练完成,将其作为判别(或生成)模型谈论它没有多大意义,因为您只使用表示,而不是模型定义的概率分布。

    【讨论】:

    • 我想我们同意 Word2Vec 的训练过程是有区别的。但是,我只是想知道如何制定表示生成过程。 (正如你所说,“生成”这个词的含义在这里更普遍。)我们总是使用任何判别或生成模型的输出。表示是输出。关于模型是判别式还是生成式的讨论集中在模型定义的内容以及如何生成输出。因此,我仍然对如何对 Word2Vec 模型进行分类感到好奇。
    • 更具体地说,从我的角度来看,对于判别模型,我们只关注条件概率并使用条件概率,而对于生成模型,我们定义联合概率,但在使用给定输入生成输出时,仍然使用条件概率在贝叶斯定理的帮助下。是否考虑联合分布是分类标准的关键。当谈到 Word2Vec 时,我感到很困惑,并且觉得很难制定。
    • 嗯,没有概率意义上的生成。表示没有分布,它基本上是一个查找表。因此,它既不是判别式也不是生成式,它是一个查找表,而不是一个概率模型。
    • Em...我想这里又出现了一个模棱两可的问题。在日常生活中,我们可以说某些事件是概率性的或确定性的。这两种事件基本上是相互排斥的。然而,在数学上,当我们用概率论解释事物时,一切都是概率的,每个项目/实例的集合都有一个分布,你命名的“查找表”当然也是如此。实际上,如果我们在训练过程中优化后预先计算所有输出,那么任何具有有限有效输入的模型在某种程度上都是“基本上是一个查找表”。
    猜你喜欢
    • 2017-10-11
    • 2021-02-27
    • 1970-01-01
    • 2023-03-16
    • 1970-01-01
    • 2016-03-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多