FDIV 通常异常比 FMUL 慢,只是 b/c 它不能像乘法一样通过管道传输,并且需要多个 clk 周期来进行迭代收敛硬件搜索过程。
最简单的方法是简单地认识到除法只不过是被除数y 和除数的倒数x 的乘积。不那么直接的部分是记住浮点值x = m * 2 ^ e 及其倒数x^-1 = (1/m)*2^(-e) = (2/m)*2^(-e-1) = p * 2^q 近似于这个新的尾数p = 2/m = 3-x, for 1<=m<2。这给出了反函数的粗略分段线性逼近,但是我们可以通过使用迭代牛顿求根方法来改进该逼近,从而做得更好。
让w = f(x) = 1/x,这个函数f(x) 的逆函数是通过根据w 或x = f^(-1)(w) = 1/w 求解x 得到的。为了提高求根方法的输出,我们必须首先创建一个函数,其零反映了所需的输出,即g(w) = 1/w - x, d/dw(g(w)) = -1/w^2。
w[n+1]= w[n] - g(w[n])/g'(w[n]) = w[n] + w[n]^2 * (1/w[n] - x) = w[n] * (2 - x*w[n])
w[n+1] = w[n] * (2 - x*w[n]), when w[n]=1/x, w[n+1]=1/x*(2-x*1/x)=1/x
然后将这些组件相加得到最后一段代码:
float inv_fast(float x) {
union { float f; int i; } v;
float w, sx;
int m;
sx = (x < 0) ? -1:1;
x = sx * x;
v.i = (int)(0x7EF127EA - *(uint32_t *)&x);
w = x * v.f;
// Efficient Iterative Approximation Improvement in horner polynomial form.
v.f = v.f * (2 - w); // Single iteration, Err = -3.36e-3 * 2^(-flr(log2(x)))
// v.f = v.f * ( 4 + w * (-6 + w * (4 - w))); // Second iteration, Err = -1.13e-5 * 2^(-flr(log2(x)))
// v.f = v.f * (8 + w * (-28 + w * (56 + w * (-70 + w *(56 + w * (-28 + w * (8 - w))))))); // Third Iteration, Err = +-6.8e-8 * 2^(-flr(log2(x)))
return v.f * sx;
}