【问题标题】:Keras training gets stuck in LSTMKeras 训练卡在 LSTM 中
【发布时间】:2019-02-28 06:54:12
【问题描述】:

我正在尝试在 Keras 中运行 LSTM 模型,但在训练部分卡住了。

对于每个 epoch,模型大约需要 3-4 秒才能将步数训练到 49x/500,然后模型就会卡住。大约 7xx 秒后,训练将恢复并完成剩余的几个步骤并完成一个 epoch。

然后它再次循环训练非常快然后冻结。

可能的原因是什么?

我运行的代码是 Francois Chollet 的 Python 深度学习一书中的编码示例 P.213。如果代码/我的硬件有问题,每个 epoch 的训练过程应该一直很慢吗?现在它在开始时训练得非常快,但在每个 epoch 结束时都会卡住。

我已尝试更新 GPU 驱动程序,conda update --all,分配另一个 GPU 来运行模型(我有 2 个 GPU)。

我确信我的 GPU 没问题,因为我运行其他模型没有问题。

【问题讨论】:

    标签: python tensorflow keras deep-learning


    【解决方案1】:

    这很正常,在每个 epoch 结束时,Keras 都会使用您的验证数据来计算验证损失和指标,这当然需要时间,也许您的验证集比您的训练集大?

    它看起来像冻结了,但它确实在验证集上进行计算,不用担心。

    【讨论】:

    • 感谢您提供有关验证部分的见解。不确定是否是由于最近对 keras 的更新,本书示例中关于 validation_steps 的代码是错误的,我更改了 validation_steps 然后模型在适当的时间运行良好。谢谢
    • @FiyeroP,你做了什么改变?
    猜你喜欢
    • 2018-01-08
    • 1970-01-01
    • 2020-05-05
    • 2017-06-27
    • 2021-06-14
    • 2019-11-25
    • 2018-01-30
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多