【发布时间】:2019-07-20 09:54:19
【问题描述】:
我正在寻找关于尽可能快地实施卷积算法以进行 CNN 推理而非训练的建议。
这种建模为 alexnet、mobilenet、resnet 等的卷积神经网络将在嵌入式 ARM 设备(A72、A53、A35)上运行,也可能在嵌入式 GPU 上运行。
我知道那里有各种实现和 NN 框架,它们具有各种实现,例如直接卷积、基于展开的卷积 (im2col)、基于 FFT 或 Winograd,但我的主要重点是在嵌入式设备的性能约束下执行 CNN。
如果有人有经验并且可以推荐用于 CPU 和并行实现的卷积实现,请指出研究论文或开源实现,我将不胜感激。
【问题讨论】:
-
FFT 有一个基于时间的版本,它首先计算完整的 ffp,然后在每个时间步只计算部分 fft,我不记得它是如何调用的,但也许它适合你的工作?跨度>