【发布时间】:2017-12-16 04:12:05
【问题描述】:
我在谷歌云机器学习引擎上运行一个非常大的 Tensorflow 模型。
使用缩放层 basic_gpu(使用 batch_size=1)时,我收到如下错误:
资源耗尽:分配形状为[1,155,240,240,16]的张量时出现OOM
因为模型太大,无法装入一个 GPU。
使用提供 4 个 GPU 的层 comple_model_m_gpu,我可以在 4 个 GPU 之间分散操作。
但是,我记得读过 GPU 之间的通信速度很慢,并且会在训练中造成瓶颈。这是真的吗?
如果是这样,是否有推荐的方法在 GPU 之间传播操作以防止出现此问题?
【问题讨论】:
标签: multithreading tensorflow tensorflow-gpu google-cloud-ml