【问题标题】:What does "fine-tuning of a BERT model" refer to?“微调 BERT 模型”指的是什么?
【发布时间】:2021-08-19 07:45:51
【问题描述】:

我无法理解一件事,当它说“微调 BERT”时,它实际上是什么意思:

  1. 我们是否使用新数据再次重新训练整个模型。
  2. 或者我们只是用新数据训练前几个转换器层。
  3. 或者我们正在训练整个模型,但将预训练的权重作为初始权重。
  4. 或者在 Transformer 层之上已经有几层 ANN,它们只是在保持 Transformer 权重冻结的情况下进行训练。

试过谷歌,但我很困惑,如果有人可以帮助我。

提前致谢!

【问题讨论】:

    标签: nlp bert-language-model huggingface-transformers transformer


    【解决方案1】:

    我记得读过关于Twitter poll 的类似上下文,而且似乎大多数 人倾向于接受您的建议3.(或其变体)作为标准定义。

    然而,这显然不能代表每一项工作,但我认为在谈论微调时通常不包括 1. 是相当安全的。除非您拥有大量(标记的)特定于任务的数据,否则此步骤将被称为预训练模型。

    2.4. 也可以被认为是微调,但根据个人/轶事经验,在微调期间允许所有参数更改提供了显着更好的结果。根据您的用例,这也很容易进行试验,因为在 Huggingface 转换器等库中冻结层是微不足道的。
    在任何一种情况下,我都会将它们视为 3. 的变体,因为您隐含地假设我们在这些场景中从预先训练的权重开始(如果我错了,请纠正我)。

    因此,尽我所能的简洁定义是:

    微调是指使用特定于任务的标记数据训练任意数量的参数/层的步骤,该模型检查点通常已使用无监督 MLM(掩码语言建模)对大量文本数据进行了训练.

    【讨论】:

    • 很明显,以上所有这些都是微调的不同阶段,但我想了解我们何时微调拥抱脸或 tf-hub BERT 模型,默认情况下它使用的是哪个阶段。
    • @ashishchandan 这取决于你问的人。
    • 我想我也合理地详细说明了问题的那一部分:大多数人假设策略 3(如果你不冻结任何东西,那么这就是你要做的确切事情拥抱脸模型)。我不能代表每个图书馆,但会假设大多数图书馆都采用相同的策略。
    猜你喜欢
    • 1970-01-01
    • 2021-07-22
    • 2020-06-10
    • 2020-06-03
    • 1970-01-01
    • 2020-09-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多