【发布时间】:2017-11-01 23:44:47
【问题描述】:
我想在 Cloud ML 上使用 Tensorflow 1.3(可能还有 1.4)。我在 Cloud ML 上的多 GPU 机器上运行作业
我通过在 setup.py 中指定 tensorflow 版本来做到这一点,如下所示:
from setuptools import setup
REQUIRED_PACKAGES = ['tensorflow==1.3.0']
setup(
name='my-image-classification',
install_requires=REQUIRED_PACKAGES,
version='1.0',
packages=['my_image_classification',
'my_image_classification/foo',
'my_image_classification/bar',
'my_image_classification/utils'],
)
Cloud ML 上安装的 cudnn 库是什么?兼容 tensorflow 1.3 和 tensorflow 1.3+ 吗?
我能够开始工作,但性能比预期值低 10 倍,我很好奇库的底层链接是否有问题
编辑:
我现在非常有信心,Cloud ML 上的 Cudnn 版本不符合 Tensorflow 1.3 的要求。我注意到 Tensorflow 1.3 作业缺少“正在创建 Tensorflow 设备 (/gpu:0...)”日志,当我使用云 ml 上的默认可用 Tensorflow 运行作业时会出现这些日志
【问题讨论】:
-
您实际上可以在哪里使用 TensorFlow r1.3 在 Cloud ML 中部署模型?几周前我尝试过,但这是不可能的。事实上,支持的运行时版本是 r1.0 和 r1.2,在此处列出:cloud.google.com/ml-engine/docs/runtime-version-list 但是,我已经能够使用 r1.3 进行训练而没有问题,如此处所述:cloud.google.com/ml-engine/docs/…。我猜部署的节点会执行 setup.py 中定义的任何 REQUIRED_PACKAGES 的标准安装,但不用于预测。
-
是的。它仍然不支持作为运行时,但这是一种解决方法。对您的 gcloud submit job .. 命令使用 --runtime-version=HEAD 命令行参数。您还应该在 setup.py 中指定 REQUIRED_PACKAGES。请参阅已接受答案下方的 cmets。
-
是的,成功了 :) 谢谢!现在我们甚至可以使用 TF 1.4 训练和部署模型,但我们无法对其进行批量预测,尽管我们可以令人惊讶地进行在线预测......
标签: tensorflow tensorflow-gpu google-cloud-ml cudnn