【发布时间】:2021-06-01 16:58:21
【问题描述】:
在迁移学习期间,我们采用预训练的网络和一些观察对(输入和标签),并使用这些数据通过反向传播来微调权重。然而,在一次性/少数镜头学习期间,根据这篇论文“语言模型是少数镜头学习者”(https://arxiv.org/pdf/2005.14165.pdf),“不执行梯度更新”。那么 GPT2 和 GPT3 等模型在 one shot/few shot 学习过程中会发生什么变化?
【问题讨论】:
在迁移学习期间,我们采用预训练的网络和一些观察对(输入和标签),并使用这些数据通过反向传播来微调权重。然而,在一次性/少数镜头学习期间,根据这篇论文“语言模型是少数镜头学习者”(https://arxiv.org/pdf/2005.14165.pdf),“不执行梯度更新”。那么 GPT2 和 GPT3 等模型在 one shot/few shot 学习过程中会发生什么变化?
【问题讨论】:
【讨论】:
您可能会认为存在一些变化,因为模型在几次训练的情况下返回了更好的结果。但是,它是相同的模型,但具有不同的上下文作为输入。 GPT-2 和 GPT-3 都是自回归模型,这意味着输出也取决于上下文。 更多的例子意味着更清晰的背景,因此获得预期结果的机会就会增加。
【讨论】: