文章目录
- 题目:STICKER: A 0.41-62.1 TOPS/W 8bit Neural Network Processor with Multi-Sparsity Compatible Convolution Arrays and Online Tuning Acceleration for Fully Connected Layers
- 时间:2018
- 会议:Symposium on VLSI Circuits
- 研究机构:清华刘勇攀
1 缩写 & 引用
- CSC: compressed sparse column
- COO: coordinate sparse matrix format
- NSG: dense format with zero-guard
- NSD: dense format without zero=guard
- IDX: index module
2 abstract & introduction
本篇论文的主要贡献:
- 自动化的sparsity detector,可以切换处理器模式
- 支持multi-sparsity的PE阵列和memory,set-associative PE支持密集和稀疏操作
- 对稀疏全连接层online tuning的PE,基于Compressed Sparse Column的后向传播
在65nm工艺下,8bit位宽实现了62.1TOPS/W,7.8平方微米,[email protected],运行的是Alexnet和lenet
3 面向稀疏性的处理器设计
3.1 sparsity-aware控制器
权重和activation分别由sparse,medium和dense三种模式,两两组合就是九种模式,PE阵列可以在这九种模式中切换,这就需要一个online activation sparsity detector
3.2 multi-sparsity compatible卷积PE阵列
不同模式下会使用不同的编码方式将activation存储在memory中:
- sparse模式:coordinate sparse matrix format (COO)
- medium模式:dense formats with zero-guards (NSG)
- dense模式:dense formats without zero-guards (NSD)
multi-sparsity compatible set-associative卷积PE阵列可以支持上面三种模式,支持不规则的部分和,具体实现是二路组相联
3.3 对稀疏全连接层的online tuning PE
两点主要的创新:
- 权重被32个量化中心聚类,用K-means算法,权重更新着干扁量化中心而不是所有的权重,这样更快
- CSC格式可以更快的后向传播