【发布时间】:2017-08-26 02:58:46
【问题描述】:
我读过Distributed Tensorflow Doc,它提到在异步训练中,
图的每个副本都有一个独立的训练循环,无需协调即可执行。
据我了解,如果我们使用具有数据并行架构的参数服务器,这意味着每个工作人员计算梯度并更新自己的权重,而无需关心其他工作人员的更新以进行分布式训练神经网络。由于所有权重都在参数服务器(ps)上共享,我认为 ps 仍然必须以某种方式协调(或聚合)所有工作人员的权重更新。我想知道聚合在异步训练中是如何工作的。或者更笼统地说,异步训练在分布式 Tensorflow 中是如何工作的?
【问题讨论】:
标签: python asynchronous tensorflow neural-network distributed