【发布时间】:2022-01-12 07:11:39
【问题描述】:
我正在参加一场关于 Kaggle 的比赛。首先,我用比赛数据集训练了一个 Longformer 基地,并在排行榜上取得了相当不错的成绩。由于 CUDA 内存限制和时间限制,我只能训练 2 个批次大小为 1 的 epoch。损失从大约 2.5 开始,在训练结束时逐渐下降到 0.6。
然后我使用保存的权重继续训练 2 个 epoch。这次我使用了稍微大一点的学习率(Longformer 论文中的那个)并将验证数据添加到训练数据中(这意味着我不再将数据集拆分为 90/10)。我这样做是为了获得更好的结果。
然而,这次损失从大约 0.4 开始,并在第一个 epoch 的大约一半时不断增加到 1.6。我停止了,因为我不想浪费计算资源。
我应该再等一下吗?它最终会导致更好的测试结果吗?我认为该模型一开始可能有点过拟合。
【问题讨论】:
标签: nlp pytorch training-data transformer