【问题标题】:TensorFlow slow on AWS p2.xlarge instanceTensorFlow 在 AWS p2.xlarge 实例上运行缓慢
【发布时间】:2017-10-31 02:51:28
【问题描述】:

我已经在 TensorFlow 中实现了 VGG 网络,并且它已经过训练。我还有 Amazon Web Services p2.xlarge 实例(Nvidia Tesla K80,12GB),安装了来自 AWS 市场的适用于 Amazon Linux 版本的 Deep Learning AMI。

当我使用网络时,图像处理大约需要 30 秒,与 TITAN X 上使用的相同网络需要 1-2 秒相比,这太长了。

有没有人有这方面的经验或任何建议如何解决这个问题?

【问题讨论】:

    标签: amazon-web-services tensorflow amazon-linux


    【解决方案1】:

    带有 p3.2xlarge (Tesla V100 GPU) 实例的“NVIDIA Volta Deep Learning AMI”怎么样?我在 2017 年 10 月 27 日尝试时的现货价格是 50 美分/小时。

    https://www.nvidia.com/en-us/gpu-cloud/?ncid=van-gpu-cloud 注册并获取您的“API 密钥”以免费使用 AMI。

    EC2/GPU 配置信息:https://aws.amazon.com/blogs/aws/new-amazon-ec2-instances-with-up-to-8-nvidia-tesla-v100-gpus-p3/

    【讨论】:

    • 但是再一次,这个实例假设比使用 Titan X 的机器要好,所以我认为另一个实例也一样,但我不知道问题出在哪里。
    • 在我的应用程序中,我重新利用了预训练的 vgg19 模型。在 p3.2xlarge 上使用 Volta AMI 的 256x256 彩色 jpeg 的推理时间约为 100 毫秒或更短。
    猜你喜欢
    • 2020-05-25
    • 1970-01-01
    • 2017-05-25
    • 1970-01-01
    • 1970-01-01
    • 2013-05-04
    • 1970-01-01
    • 2021-07-07
    • 1970-01-01
    相关资源
    最近更新 更多