【问题标题】:Why does changing 0.1f to 0 slow down performance by 10x?为什么将 0.1f 更改为 0 会使性能降低 10 倍?
【发布时间】:2012-03-08 01:02:11
【问题描述】:

为什么会有这段代码,

const float x[16] = {  1.1,   1.2,   1.3,     1.4,   1.5,   1.6,   1.7,   1.8,
                       1.9,   2.0,   2.1,     2.2,   2.3,   2.4,   2.5,   2.6};
const float z[16] = {1.123, 1.234, 1.345, 156.467, 1.578, 1.689, 1.790, 1.812,
                     1.923, 2.034, 2.145,   2.256, 2.367, 2.478, 2.589, 2.690};
float y[16];
for (int i = 0; i < 16; i++)
{
    y[i] = x[i];
}

for (int j = 0; j < 9000000; j++)
{
    for (int i = 0; i < 16; i++)
    {
        y[i] *= x[i];
        y[i] /= z[i];
        y[i] = y[i] + 0.1f; // <--
        y[i] = y[i] - 0.1f; // <--
    }
}

运行速度比后面的位快 10 倍以上(除特别说明外相同)?

const float x[16] = {  1.1,   1.2,   1.3,     1.4,   1.5,   1.6,   1.7,   1.8,
                       1.9,   2.0,   2.1,     2.2,   2.3,   2.4,   2.5,   2.6};
const float z[16] = {1.123, 1.234, 1.345, 156.467, 1.578, 1.689, 1.790, 1.812,
                     1.923, 2.034, 2.145,   2.256, 2.367, 2.478, 2.589, 2.690};
float y[16];
for (int i = 0; i < 16; i++)
{
    y[i] = x[i];
}

for (int j = 0; j < 9000000; j++)
{
    for (int i = 0; i < 16; i++)
    {
        y[i] *= x[i];
        y[i] /= z[i];
        y[i] = y[i] + 0; // <--
        y[i] = y[i] - 0; // <--
    }
}

使用 Visual Studio 2010 SP1 编译时。 优化级别为-02,启用sse2。 我没有用其他编译器测试过。

【问题讨论】:

  • 您是如何衡量差异的?你在编译时使用了哪些选项?
  • 为什么编译器在这种情况下不直接删除 +/- 0?!?
  • @Zyx2000 编译器可没有那么愚蠢。在 LINQPad 中反汇编一个简单的示例表明,无论您在需要double 的上下文中使用00f0d,甚至(int)0,它都会吐出相同的代码。
  • 优化级别是多少?

标签: c++ performance visual-studio-2010 compilation floating-point


【解决方案1】:

欢迎来到 denormalized floating-point 的世界!他们会严重破坏性能!!!

非正规(或次正规)数字是一种从浮点表示中获得一些非常接近零的额外值的技巧。非规范化浮点运算可能比规范化浮点运算慢几十到几百倍。这是因为许多处理器不能直接处理它们,必须使用微码捕获和解析它们。

如果您在 10,000 次迭代后打印出这些数字,您会看到它们已经收敛到不同的值,具体取决于使用的是 0 还是 0.1

这是在 x64 上编译的测试代码:

int main() {

    double start = omp_get_wtime();

    const float x[16]={1.1,1.2,1.3,1.4,1.5,1.6,1.7,1.8,1.9,2.0,2.1,2.2,2.3,2.4,2.5,2.6};
    const float z[16]={1.123,1.234,1.345,156.467,1.578,1.689,1.790,1.812,1.923,2.034,2.145,2.256,2.367,2.478,2.589,2.690};
    float y[16];
    for(int i=0;i<16;i++)
    {
        y[i]=x[i];
    }
    for(int j=0;j<9000000;j++)
    {
        for(int i=0;i<16;i++)
        {
            y[i]*=x[i];
            y[i]/=z[i];
#ifdef FLOATING
            y[i]=y[i]+0.1f;
            y[i]=y[i]-0.1f;
#else
            y[i]=y[i]+0;
            y[i]=y[i]-0;
#endif

            if (j > 10000)
                cout << y[i] << "  ";
        }
        if (j > 10000)
            cout << endl;
    }

    double end = omp_get_wtime();
    cout << end - start << endl;

    system("pause");
    return 0;
}

输出:

#define FLOATING
1.78814e-007  1.3411e-007  1.04308e-007  0  7.45058e-008  6.70552e-008  6.70552e-008  5.58794e-007  3.05474e-007  2.16067e-007  1.71363e-007  1.49012e-007  1.2666e-007  1.11759e-007  1.04308e-007  1.04308e-007
1.78814e-007  1.3411e-007  1.04308e-007  0  7.45058e-008  6.70552e-008  6.70552e-008  5.58794e-007  3.05474e-007  2.16067e-007  1.71363e-007  1.49012e-007  1.2666e-007  1.11759e-007  1.04308e-007  1.04308e-007

//#define FLOATING
6.30584e-044  3.92364e-044  3.08286e-044  0  1.82169e-044  1.54143e-044  2.10195e-044  2.46842e-029  7.56701e-044  4.06377e-044  3.92364e-044  3.22299e-044  3.08286e-044  2.66247e-044  2.66247e-044  2.24208e-044
6.30584e-044  3.92364e-044  3.08286e-044  0  1.82169e-044  1.54143e-044  2.10195e-044  2.45208e-029  7.56701e-044  4.06377e-044  3.92364e-044  3.22299e-044  3.08286e-044  2.66247e-044  2.66247e-044  2.24208e-044

请注意,在第二次运行中,数字非常接近于零。

非规范化数字通常很少见,因此大多数处理器不会尝试有效地处理它们。


为了证明这与非规范化数字有关,如果我们通过将其添加到代码开头来将非规范化清零

_MM_SET_FLUSH_ZERO_MODE(_MM_FLUSH_ZERO_ON);

然后0 的版本不再慢 10 倍,实际上变得更快。 (这需要在启用 SSE 的情况下编译代码。)

这意味着我们不使用这些奇怪的低精度几乎为零的值,而是直接舍入到零。

时序:Core i7 920 @ 3.5 GHz:

//  Don't flush denormals to zero.
0.1f: 0.564067
0   : 26.7669

//  Flush denormals to zero.
0.1f: 0.587117
0   : 0.341406

最后,这真的与它是整数还是浮点无关。 00.1f 被转换/存储到两个循环之外的寄存器中。所以这对性能没有影响。

【讨论】:

  • 我仍然觉得编译器默认没有完全优化“+ 0”有点奇怪。如果他输入“+ 0.0f”会发生这种情况吗?
  • @s73v3r 这是一个非常好的问题。现在我查看了程序集,甚至 + 0.0f 都没有得到优化。如果我不得不猜测,如果y[i] 碰巧是一个信号NaN 或其他什么东西,+ 0.0f 可能会产生副作用......不过我可能是错的。
  • 在许多情况下,双打仍然会遇到同样的问题,只是数量级不同。清零适用于音频应用程序(以及其他可以承受在这里和那里丢失 1e-38 的应用程序),但我相信不适用于 x87。如果没有 FTZ,音频应用程序的通常解决方法是注入非常低幅度(听不见)的 DC 或方波信号,以使数字远离异常。
  • @Isaac 因为当 y[i] 显着小于 0.1 时,添加它会导致精度损失,因为数字中的最高有效数字变得更高。
  • @s73v3r:+0.f 无法优化掉,因为浮点数为负0,+0.f 加到-.0f 的结果是+0.f。所以加 0.f 不是恒等运算,不能优化出来。
【解决方案2】:

使用gcc 并对生成的程序集应用差异只会产生这种差异:

73c68,69
<   movss   LCPI1_0(%rip), %xmm1
---
>   movabsq $0, %rcx
>   cvtsi2ssq   %rcx, %xmm1
81d76
<   subss   %xmm1, %xmm0

cvtsi2ssq 确实慢了 10 倍。

显然,float 版本使用从内存加载的XMM 寄存器,而int 版本使用cvtsi2ssq 指令将真正的int 值0 转换为float,花费大量时间.将 -O3 传递给 gcc 并没有帮助。 (gcc 版本 4.2.1。)

(使用double 代替float 无关紧要,只是它将cvtsi2ssq 更改为cvtsi2sdq。)

更新

一些额外的测试表明它不一定是cvtsi2ssq 指令。一旦消除(使用int ai=0;float a=ai; 并使用a 而不是0),速度差异仍然存在。所以@Mysticial 是对的,非规范化的浮点数会有所不同。这可以通过测试00.1f 之间的值来看出。上述代码中的转折点大约在0.00000000000000000000000000000001,此时循环突然需要10倍的时间。

更新

这个有趣现象的小可视化:

  • 第 1 列:浮点数,每次迭代除以 2
  • 第 2 列:此浮点数的二进制表示
  • 第 3 列:将此浮点数求和 1e7 次所用的时间

当非规范化开始时,您可以清楚地看到指数(最后 9 位)变为最低值。此时,简单的加法会慢 20 倍。

0.000000000000000000000000000000000100000004670110: 10111100001101110010000011100000 45 ms
0.000000000000000000000000000000000050000002335055: 10111100001101110010000101100000 43 ms
0.000000000000000000000000000000000025000001167528: 10111100001101110010000001100000 43 ms
0.000000000000000000000000000000000012500000583764: 10111100001101110010000110100000 42 ms
0.000000000000000000000000000000000006250000291882: 10111100001101110010000010100000 48 ms
0.000000000000000000000000000000000003125000145941: 10111100001101110010000100100000 43 ms
0.000000000000000000000000000000000001562500072970: 10111100001101110010000000100000 42 ms
0.000000000000000000000000000000000000781250036485: 10111100001101110010000111000000 42 ms
0.000000000000000000000000000000000000390625018243: 10111100001101110010000011000000 42 ms
0.000000000000000000000000000000000000195312509121: 10111100001101110010000101000000 43 ms
0.000000000000000000000000000000000000097656254561: 10111100001101110010000001000000 42 ms
0.000000000000000000000000000000000000048828127280: 10111100001101110010000110000000 44 ms
0.000000000000000000000000000000000000024414063640: 10111100001101110010000010000000 42 ms
0.000000000000000000000000000000000000012207031820: 10111100001101110010000100000000 42 ms
0.000000000000000000000000000000000000006103515209: 01111000011011100100001000000000 789 ms
0.000000000000000000000000000000000000003051757605: 11110000110111001000010000000000 788 ms
0.000000000000000000000000000000000000001525879503: 00010001101110010000100000000000 788 ms
0.000000000000000000000000000000000000000762939751: 00100011011100100001000000000000 795 ms
0.000000000000000000000000000000000000000381469876: 01000110111001000010000000000000 896 ms
0.000000000000000000000000000000000000000190734938: 10001101110010000100000000000000 813 ms
0.000000000000000000000000000000000000000095366768: 00011011100100001000000000000000 798 ms
0.000000000000000000000000000000000000000047683384: 00110111001000010000000000000000 791 ms
0.000000000000000000000000000000000000000023841692: 01101110010000100000000000000000 802 ms
0.000000000000000000000000000000000000000011920846: 11011100100001000000000000000000 809 ms
0.000000000000000000000000000000000000000005961124: 01111001000010000000000000000000 795 ms
0.000000000000000000000000000000000000000002980562: 11110010000100000000000000000000 835 ms
0.000000000000000000000000000000000000000001490982: 00010100001000000000000000000000 864 ms
0.000000000000000000000000000000000000000000745491: 00101000010000000000000000000000 915 ms
0.000000000000000000000000000000000000000000372745: 01010000100000000000000000000000 918 ms
0.000000000000000000000000000000000000000000186373: 10100001000000000000000000000000 881 ms
0.000000000000000000000000000000000000000000092486: 01000010000000000000000000000000 857 ms
0.000000000000000000000000000000000000000000046243: 10000100000000000000000000000000 861 ms
0.000000000000000000000000000000000000000000022421: 00001000000000000000000000000000 855 ms
0.000000000000000000000000000000000000000000011210: 00010000000000000000000000000000 887 ms
0.000000000000000000000000000000000000000000005605: 00100000000000000000000000000000 799 ms
0.000000000000000000000000000000000000000000002803: 01000000000000000000000000000000 828 ms
0.000000000000000000000000000000000000000000001401: 10000000000000000000000000000000 815 ms
0.000000000000000000000000000000000000000000000000: 00000000000000000000000000000000 42 ms
0.000000000000000000000000000000000000000000000000: 00000000000000000000000000000000 42 ms
0.000000000000000000000000000000000000000000000000: 00000000000000000000000000000000 44 ms

有关 ARM 的等效讨论可以在 StackOverflow 问题中找到Denormalized floating point in Objective-C?

【讨论】:

  • -Os 不会修复它,但 -ffast-math 会。 (我一直都在使用它,IMO 导致精度问题的极端情况无论如何都不应该出现在设计合理的程序中。)
  • gcc-4.6 在任何正优化级别都没有转换。
  • @leftaroundabout:使用-ffast-math 编译可执行文件(不是库)链接了一些额外的启动代码,这些代码在 MXCSR 中设置 FTZ(刷新为零)和 DAZ(非正常为零),因此 CPU 永远不会必须对非规范化采取缓慢的微码辅助。
【解决方案3】:

这是由于非规范化的浮点使用造成的。如何摆脱它和性能损失?在互联网上搜索杀死非正规数的方法后,似乎还没有“最好”的方法来做到这一点。我发现这三种方法可能在不同的环境中效果最好:

  • 在某些 GCC 环境中可能无法工作:

    // Requires #include <fenv.h>
    fesetenv(FE_DFL_DISABLE_SSE_DENORMS_ENV);
    
  • 在某些 Visual Studio 环境中可能不起作用:1

    // Requires #include <xmmintrin.h>
    _mm_setcsr( _mm_getcsr() | (1<<15) | (1<<6) );
    // Does both FTZ and DAZ bits. You can also use just hex value 0x8040 to do both.
    // You might also want to use the underflow mask (1<<11)
    
  • 似乎在 GCC 和 Visual Studio 中都可以使用:

    // Requires #include <xmmintrin.h>
    // Requires #include <pmmintrin.h>
    _MM_SET_FLUSH_ZERO_MODE(_MM_FLUSH_ZERO_ON);
    _MM_SET_DENORMALS_ZERO_MODE(_MM_DENORMALS_ZERO_ON);
    
  • Intel 编译器具有在现代 Intel CPU 上默认禁用非规范化的选项。 More details here

  • 编译器开关。 -ffast-math-msse-mfpmath=sse 将禁用非规范化并使其他一些事情变得更快,但不幸的是,还会执行许多其他可能会破坏您的代码的近似值。仔细测试! Visual Studio 编译器的 fast-math 等效项是 /fp:fast,但我无法确认这是否也会禁用非规范化。1

【讨论】:

  • 这听起来像是对一个不同但相关的问题(如何防止数值计算产生异常结果?)的一个不错的答案,但它没有回答这个问题。
  • Windows X64 在启动 .exe 时会传递突然下溢的设置,而 Windows 32 位和 linux 则不会。在 linux 上, gcc -ffast-math 应该设置突然下溢(但我认为不是在 Windows 上)。英特尔编译器应该在 main() 中初始化,这样这些操作系统差异就不会通过,但我已经被咬了,需要在程序中明确设置。从 Sandy Bridge 开始的 Intel CPU 应该能够有效地处理加/减(但不是除/乘)中出现的次正规,因此有使用逐渐下溢的情况。
  • Microsoft /fp:fast(非默认)不会执行 gcc -ffast-math 或 ICL(默认)/fp:fast 中固有的任何激进的事情。它更像 ICL /fp:source。因此,如果您想比较这些编译器,则必须显式设置 /fp:(并且在某些情况下,下溢模式)。
【解决方案4】:

在 gcc 中,您可以通过以下方式启用 FTZ 和 DAZ:

#include <xmmintrin.h>

#define FTZ 1
#define DAZ 1   

void enableFtzDaz()
{
    int mxcsr = _mm_getcsr ();

    if (FTZ) {
            mxcsr |= (1<<15) | (1<<11);
    }

    if (DAZ) {
            mxcsr |= (1<<6);
    }

    _mm_setcsr (mxcsr);
}

也使用 gcc 开关:-msse -mfpmath=sse

(对应于 Carl Hetherington [1])

[1]http://carlh.net/plugins/denormals.php

【讨论】:

  • 另见fesetround() from fenv.h(为C99定义)另一种更便携的舍入方式(linux.die.net/man/3/fesetround)(但这是would affect all FP operations, not just subnormals
  • 您确定需要 1
  • @fig: 1softpixel.com/~cwright/programming/simd/sse.php
  • @GermanGarcia 这没有回答 OP 的问题;问题是“为什么这段代码的运行速度比...快 10 倍” - 您应该在提供此解决方法之前尝试回答这个问题,或者在评论中提供。
【解决方案5】:

Dan Neely's comment 应该扩展为答案:

不是零常数0.0f 被非规范化或导致减速,而是每次循环迭代接近零的值。随着它们越来越接近于零,它们需要更高的精度来表示并且它们变得非规范化。这些是y[i] 值。 (它们接近于零,因为对于所有 ix[i]/z[i] 小于 1.0。)

代码的慢版本和快版本之间的关键区别在于声明y[i] = y[i] + 0.1f;。一旦在循环的每次迭代中执行此行,浮点中的额外精度就会丢失,并且不再需要表示该精度所需的非规范化。之后,y[i] 上的浮点运算仍然很快,因为它们没有被非规范化。

为什么添加0.1f 时会丢失额外的精度?因为浮点数只有这么多有效数字。假设您有足够的存储空间来存储三个有效数字,然后是 0.00001 = 1e-50.00001 + 0.1 = 0.1,至少对于这个示例浮点格式,因为它没有空间存储 0.10001 中的最低有效位。

简而言之,y[i]=y[i]+0.1f; y[i]=y[i]-0.1f; 并不是您想象中的空操作。

Mystical said this as well:浮点数的内容很重要,而不仅仅是汇编代码。

编辑:为了更好地说明这一点,即使机器操作码相同,也不是每个浮点运算都需要相同的时间来运行。对于某些操作数/输入,相同的指令将需要更多时间来运行。对于非正规数尤其如此。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-08-30
    • 1970-01-01
    • 2022-11-16
    • 2016-08-08
    • 2021-04-19
    相关资源
    最近更新 更多