【发布时间】:2017-10-07 09:16:34
【问题描述】:
ThisTensorFlow 指南提供了一些关于神经网络权重和激活的 8 位表示的见解。它通过将 float32 中的最小值映射到 int8 中的 0 并将最大值映射到 255 来映射从 float32 中的 min-max 到 8bit 格式的范围。这意味着加法标识 (0) 映射到非零值甚至乘法标识 ( 1) 可以映射到 int8 表示中的 1 以外的值。我的问题是,
在失去这些身份之后,如何在新的表示中执行算术?在加/减的情况下,我们可以在适当的缩放和偏移后取回大约 float32 的数字。
如何将int8格式的乘法结果转换为原生的float32格式?
【问题讨论】:
标签: math tensorflow quantization 8-bit