【问题标题】:Changes in GPT2/GPT3 model during few shot learning少数镜头学习期间 GPT2/GPT3 模型的变化
【发布时间】:2021-06-01 16:58:21
【问题描述】:

在迁移学习期间,我们采用预训练的网络和一些观察对(输入和标签),并使用这些数据通过反向传播来微调权重。然而,在一次性/少数镜头学习期间,根据这篇论文“语言模型是少数镜头学习者”(https://arxiv.org/pdf/2005.14165.pdf),“不执行梯度更新”。那么 GPT2 和 GPT3 等模型在 one shot/few shot 学习过程中会发生什么变化?

【问题讨论】:

    标签: nlp gpt-2 gpt-3


    【解决方案1】:

    那么 GPT2 和 GPT3 等模型在 one shot/few shot 学习过程中会发生什么变化?

    模型完全没有变化。该模型不会保存地学习任何东西。他们所做的是将“训练示例”作为模型的上下文,模型在此上下文结束时生成输出。图 2.1 (Brown, Tom B., et al.“Language models are few-shot learningers.”(2020 年)。) 显示了微调、零样本学习和少量学习。

    如您所见,训练示例是输入的一部分,并且必须在每次进行预测时提供。因此,模型没有发生任何变化。 Brown,Tom B. 等人。 “语言模型是少数人的学习者。”(2020)

    【讨论】:

      【解决方案2】:

      您可能会认为存在一些变化,因为模型在几次训练的情况下返回了更好的结果。但是,它是相同的模型,但具有不同的上下文作为输入。 GPT-2 和 GPT-3 都是自回归模型,这意味着输出也取决于上下文。 更多的例子意味着更清晰的背景,因此获得预期结果的机会就会增加。

      【讨论】:

        猜你喜欢
        • 2018-12-04
        • 2022-12-14
        • 1970-01-01
        • 2016-03-14
        • 1970-01-01
        • 1970-01-01
        • 2019-11-21
        • 2017-07-16
        • 1970-01-01
        相关资源
        最近更新 更多