【发布时间】:2021-08-19 07:45:51
【问题描述】:
我无法理解一件事,当它说“微调 BERT”时,它实际上是什么意思:
- 我们是否使用新数据再次重新训练整个模型。
- 或者我们只是用新数据训练前几个转换器层。
- 或者我们正在训练整个模型,但将预训练的权重作为初始权重。
- 或者在 Transformer 层之上已经有几层 ANN,它们只是在保持 Transformer 权重冻结的情况下进行训练。
试过谷歌,但我很困惑,如果有人可以帮助我。
提前致谢!
【问题讨论】:
标签: nlp bert-language-model huggingface-transformers transformer