【问题标题】:Which checkpoint should I select for continue for Object detection training我应该选择哪个检查点继续进行对象检测训练
【发布时间】:2022-05-16 05:51:28
【问题描述】:

我开始训练直到 ckpt-7,然后我停止训练。然后我再次开始训练,但是在我更改了 pipline 配置之前,我在模型上微调了检查点。我写了最新的检查点,我改变了它的目录。在停止训练之前,我的损失函数大约为 0.899。 当我继续训练但它开始到第 100 步和我的损失函数 15.009。

如何在停止之前继续模型?我该怎么办?

我在 Colab 中使用 centernet 模型。 请说明我是该主题的新手。

【问题讨论】:

  • 您可以尝试在开头使用tf.train.CheckpointManager。它通过保留最近的检查点并删除旧的检查点来管理多个检查点。如果你的模型过拟合,那么损失会增加。为了减少尝试调整超参数。 mini_batch_size,learning_rateoptimizer 对目标检测客观指标的影响最大。谢谢!

标签: tensorflow deep-learning google-colaboratory object-detection training-data


【解决方案1】:

我能理解您的问题,即您无法从停止的地方恢复训练。

其实在 TF2 的更新中,我们不需要更改 pipeline.config 中的finetune checkpoint 参数。重新运行指向存储检查点的同一 model_dir 的相同训练脚本。

TF2 将在 model_dir 中创建的检查点的帮助下自动理解并从哪里恢复训练。

【讨论】:

    猜你喜欢
    • 2020-05-22
    • 2019-04-05
    • 2021-06-14
    • 1970-01-01
    • 2021-11-25
    • 2020-12-13
    • 1970-01-01
    • 2020-06-17
    • 2014-01-11
    相关资源
    最近更新 更多