【问题标题】:Cloud ML Tensorflow and Cudnn versions compatibilityCloud ML Tensorflow 和 Cudnn 版本兼容性
【发布时间】:2017-11-01 23:44:47
【问题描述】:

我想在 Cloud ML 上使用 Tensorflow 1.3(可能还有 1.4)。我在 Cloud ML 上的多 GPU 机器上运行作业

我通过在 setup.py 中指定 tensorflow 版本来做到这一点,如下所示:

from setuptools import setup

REQUIRED_PACKAGES = ['tensorflow==1.3.0']

setup(
    name='my-image-classification',
    install_requires=REQUIRED_PACKAGES,
    version='1.0',
    packages=['my_image_classification',
              'my_image_classification/foo',
              'my_image_classification/bar',
              'my_image_classification/utils'],
    )

Cloud ML 上安装的 cudnn 库是什么?兼容 tensorflow 1.3 和 tensorflow 1.3+ 吗?

我能够开始工作,但性能比预期值低 10 倍,我很好奇库的底层链接是否有问题

编辑:

我现在非常有信心,Cloud ML 上的 Cudnn 版本不符合 Tensorflow 1.3 的要求。我注意到 Tensorflow 1.3 作业缺少“正在创建 Tensorflow 设备 (/gpu:0...)”日志,当我使用云 ml 上的默认可用 Tensorflow 运行作业时会出现这些日志

【问题讨论】:

  • 您实际上可以在哪里使用 TensorFlow r1.3 在 Cloud ML 中部署模型?几周前我尝试过,但这是不可能的。事实上,支持的运行时版本是 r1.0 和 r1.2,在此处列出:cloud.google.com/ml-engine/docs/runtime-version-list 但是,我已经能够使用 r1.3 进行训练而没有问题,如此处所述:cloud.google.com/ml-engine/docs/…。我猜部署的节点会执行 setup.py 中定义的任何 REQUIRED_PACKAGES 的标准安装,但不用于预测。
  • 是的。它仍然不支持作为运行时,但这是一种解决方法。对您的 gcloud submit job .. 命令使用 --runtime-version=HEAD 命令行参数。您还应该在 setup.py 中指定 REQUIRED_PACKAGES。请参阅已接受答案下方的 cmets。
  • 是的,成功了 :) 谢谢!现在我们甚至可以使用 TF 1.4 训练和部署模型,但我们无法对其进行批量预测,尽管我们可以令人惊讶地进行在线预测......

标签: tensorflow tensorflow-gpu google-cloud-ml cudnn


【解决方案1】:

免责声明:自 2017 年 11 月 1 日起,官方不支持使用 1.0 和 1.2 以外的任何版本。

您需要指定支持 GPU 的 TensorFlow 版本:

REQUIRED_PACKAGES = ['tensorflow-gpu==1.3.0']

但是pip的版本已经过时了,所以你需要先强制更新。

【讨论】:

  • 这打破了我的导入错误:import tensorflow as tf ERROR 2017-11-02 12:41:12 -0700 service ImportError: No module named tensorflow
  • 啊,pip 版本在服务上太旧了。提交作业时尝试使用 --runtime-version=HEAD。同样的免责声明也适用。
猜你喜欢
  • 1970-01-01
  • 2018-12-31
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-12-12
  • 2019-11-13
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多