【问题标题】:Fast implementation of convolution for CNN inference卷积神经网络推理的快速实现
【发布时间】:2019-07-20 09:54:19
【问题描述】:

我正在寻找关于尽可能快地实施卷积算法以进行 CNN 推理而非训练的建议。

这种建模为 alexnet、mobilenet、resnet 等的卷积神经网络将在嵌入式 ARM 设备(A72、A53、A35)上运行,也可能在嵌入式 GPU 上运行。

我知道那里有各种实现和 NN 框架,它们具有各种实现,例如直接卷积、基于展开的卷积 (im2col)、基于 FFT 或 Winograd,但我的主要重点是在嵌入式设备的性能约束下执行 CNN。

如果有人有经验并且可以推荐用于 CPU 和并行实现的卷积实现,请指出研究论文或开源实现,我将不胜感激。

【问题讨论】:

  • FFT 有一个基于时间的版本,它首先计算完整的 ffp,然后在每个时间步只计算部分 fft,我不记得它是如何调用的,但也许它适合你的工作?跨度>

标签: conv-neural-network gpgpu


【解决方案1】:

如果它仍然是真实的。我找到了一个small framework 来推断 CPU 上的预训练神经网络。它使用Simd Library 来加速其工作。该库具有非常快速(单线程)的卷积、池化、Relu 和许多其他 CPU(x86 和 ARM)网络层的实现。 CNN卷积包括Winograd的方法。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2019-05-31
    • 2020-08-20
    • 2017-01-01
    • 1970-01-01
    • 2017-08-06
    • 2015-11-05
    • 1970-01-01
    相关资源
    最近更新 更多