论文《通过随机哈希实现可扩展、可持续的深度学习》(Scalable and Sustainable Deep Learning via Randomized Hashing),已经作为 Oral 被 KDD 2017 接收,虽然论文的同行评议版本要到 KDD 召开时才能得知,通过网上的资料,我们可以看到去年底 Spring 在 arXiv 上传的论文预印版(地址:https://arxiv.org/pdf/1602.08194.pdf)。

下面是论文的摘要。

记录一些hash的东西

为了从复杂的数据集中学习,当前深度学习框架越来越大。这些框架需要进行巨大的矩阵乘法运算来训练数百万个参数。与此相反,另一个呈增长的趋势是将深度学习带入低功耗、嵌入式设备。为了训练和测试深度网络而进行的相关矩阵运算,从计算和能量消耗的角度看是非常昂贵的。我们提出了一种基于 Hashing 的新技术,大幅减少了训练和测试神经网络所需的计算量。我们的方法结合了最近提出的两大概念,即自适应 dropout 和最大内部搜索(MIPS)随机 Hashing,有效选择网络中具有最高**的节点。

这一新深度学习算法通过在(数量明显更少的)稀疏节点上运行,减少前向和后向传播步骤的总体计算成本。因此,我们的算法在保持原始模型平均精度 1% 的同时,仅使用总乘法的 5%。

论文提出的基于 Hashing 的反向传播算法,一个独特属性是 update 总是稀疏的。而由于稀疏梯度 update,我们的算法非常适合异构和并行训练。通过在几个真实数据集上进行严格的实验评估,我们证明了提出的算法具有可扩展性和可持续性(能量效率高)。

神经网络进行随机哈希的视觉展示

记录一些hash的东西

图1:从图中可见,神经网络 Low-Rank 假设需要的参数数量自然会更少

记录一些hash的东西

图2:对神经网络进行随机哈希的视觉展示。① 建一个哈希表,方法是对每个隐藏层(一次迭代)的权重做哈希。② 使用该层的随机哈希函数对该层的输入做哈希。③ 查询这一层的哈希表,获取**数据集 AS。④ 仅在**神经元上做前向和后向传播。⑤ 更新 AS 权重和哈希表。

56 核的英特尔 Xeon ES-2697 处理器上的性能比较

记录一些hash的东西

图7:一个标准网络使用我们的方法(随机哈希)和使用异构随机梯度下降,在56 核的英特尔Xeon ES-2697 处理器上的性能比较。我们依次在MNIST、NORB、Convex 和Rectangles 数据集上进行了测试。所有网络的初始值都是一样的。

记录一些hash的东西

图8:新方法(LSH-5%)使用异构随机梯度下降每步(per epoch)获得的挂钟时间。我们用一个有 3 层隐藏层的网络,依次在 MNIST、NORB、Convex 和 Rectangles 数据集上进行了测试。Convex 和 Rectangles 数据集上增量较少,是因为在整个过程中可用的训练样本不够多。实验中只使用了 5% 的标准网络计算量。



相关文章:

  • 2021-05-18
  • 2021-11-18
  • 2022-12-23
  • 2022-12-23
  • 2021-07-22
  • 2021-07-27
  • 2021-11-17
  • 2022-02-26
猜你喜欢
  • 2021-08-14
  • 2021-12-10
  • 2021-06-14
  • 2022-12-23
  • 2022-12-23
  • 2022-12-23
  • 2022-01-16
相关资源
相似解决方案