【问题标题】:Tensorflow 2.3.x cudnn failure Windows 10 CUDA 10.1 CUDNN 7.6.5 Anaconda3Tensorflow 2.3.x cudnn 故障 Windows 10 CUDA 10.1 CUDNN 7.6.5 Anaconda3
【发布时间】:2021-01-29 10:19:10
【问题描述】:

运行 TensorFlow 2.3.x 然后停止然后再次运行似乎会导致 TensorFlow 无法初始化 cudnn。在微调和调试前后处理时,这种停止和启动是不可避免的。每次 cudnn 失败时,我都必须重新启动计算机。这种失败似乎每次运行发生的概率为 50%。

我的设置是 Windows 10、CUDA 10.1 Update 2、CUDNN 7.6.5、Anaconda3 python 3.7/3.6、TensorFlow 2.3.0/2.3.1、NVIDIA RTX2080ti。我遵循https://www.tensorflow.org/install/gpu 中列出的确切要求,但这几乎无法使用。

我已经尝试过 python 3.7、python 3.6、cudnn 7.6.x 和 CUDA 10.1 original、update 1、update 2 和 TensorFlow 2.2.0。所有结果都相同。 Tensorflow 打印输出显示所有 dll 均已成功加载,包括 cudnn64_7.dll。为什么这么不稳定?

任何见解将不胜感激。

【问题讨论】:

  • "dlls 已成功加载" 没有任何意义。我对此没有解决方案,但我可以告诉你。这是超级用户可能会更好地解决的“在线”问题之一。你在写代码吗?这是编程问题吗?你也可以去那里试试。
  • 过去,当 dll 加载失败时会发生此错误。打印输出将显示某些 cuda/cudnn dll 无法加载。你可以简单地再次运行它,一切都会正常工作。我正在编写代码,但 TensorFlow 和 python 处理所有内存管理和句柄,因此我无法控制任何这些问题,除非问题是由于 TensorFlow api 调用之一中的错误而出现的。我知道 dll 和头文件需要完全匹配。 TensorFlow 指定 cudnn 7.6 和 cuda 10.1,但有 18 个排列可以满足这些要求,并且在 python 中几乎是无限的。

标签: windows tensorflow installation gpu


【解决方案1】:

经过几天的调试,我发现问题不在于 CUDA、CUDNN、TensorFlow、Python、Anaconda,而实际上是 Windows 10。

为了让 Linux 虚拟机在 Windows 中运行,我错误地加入了 Windows Insider 计划。这有效,但随后 TensorFlow 停止在 Windows 中正常工作。我读到内部程序有副作用,所以我重新安装了(这是在 10 天或更新后恢复到标准版本的唯一方法)。我没有意识到 Windows 发布了一个主要版本更新 V2004,并认为我正在回到原来的状态。因此,当我完成安装过程时,我下载了最新版本的 TF,并认为这是问题所在。

我启动了一台旧计算机并在其上正常运行我的代码。然后我注意到 Windows 版本差异并将我的旧计算机升级到 2004。一切仍然有效。然后我找到了一个 1909 的 ISO 并将其安装在我的主计算机上,一切又开始工作了。

总而言之,Windows 10 V2004 似乎不允许正确安装这些工具,但只要您不必重新安装任何东西,从 V1909 升级到 V2004 仍然有效。谁知道当 TF 支持 CUDA 11 时会发生什么。Windows 10 V2004 用户可能不得不坚持使用旧版本的 TF。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-12-12
    • 2021-01-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-09-29
    • 2019-05-04
    • 1970-01-01
    相关资源
    最近更新 更多