【发布时间】:2019-06-25 11:52:04
【问题描述】:
我正在训练一个语义分割模型。我正在使用 10 个图像的批量大小在单个 GPU 上进行训练。我同时使用相同的超参数在多 GPU(3 个 GPU)设置上进行训练。对于多 GPU,我使用 30 个图像的批量大小,即每个 GPU 10 个图像。
理论上,对于单 GPU 和多 GPU 训练过程,训练期间每个 epoch 中每步的损失值是否应该是相同的值范围?
就我而言,这不是我目前在训练期间看到的。多 GPU 的损失比我从单 GPU 得到的损失值大 5 倍。
欢迎提出任何意见/建议。
【问题讨论】:
标签: tensorflow deep-learning gpu