【发布时间】:2013-09-27 21:26:00
【问题描述】:
我正在编译这段 C 代码:
int mode; // use aa if true, else bb
int aa[2];
int bb[2];
inline int auto0() { return mode ? aa[0] : bb[0]; }
inline int auto1() { return mode ? aa[1] : bb[1]; }
int slow() { return auto1() - auto0(); }
int fast() { return mode ? aa[1] - aa[0] : bb[1] - bb[0]; }
slow() 和 fast() 函数都旨在做同样的事情,尽管 fast() 使用一个分支语句而不是两个。我想检查 GCC 是否会将两个分支合并为一个。我已经在 GCC 4.4 和 4.7 上尝试过,并使用了各种级别的优化,例如 -O2、-O3、-Os 和 -Ofast。它总是给出同样奇怪的结果:
慢():
movl mode(%rip), %ecx
testl %ecx, %ecx
je .L10
movl aa+4(%rip), %eax
movl aa(%rip), %edx
subl %edx, %eax
ret
.L10:
movl bb+4(%rip), %eax
movl bb(%rip), %edx
subl %edx, %eax
ret
快速():
movl mode(%rip), %esi
testl %esi, %esi
jne .L18
movl bb+4(%rip), %eax
subl bb(%rip), %eax
ret
.L18:
movl aa+4(%rip), %eax
subl aa(%rip), %eax
ret
确实,每个函数只生成一个分支。然而,slow() 似乎以一种令人惊讶的方式劣势:它在每个分支中使用了一个额外的负载,用于aa[0] 和bb[0]。 fast() 代码直接从subls 的内存中使用它们,而无需先将它们加载到寄存器中。所以slow() 每次调用使用一个额外的寄存器和一个额外的指令。
一个简单的微基准测试表明,调用 fast() 十亿次需要 0.7 秒,而 slow() 需要 1.1 秒。我使用的是 2.9 GHz 的 Xeon E5-2690。
为什么会这样?你能以某种方式调整我的源代码,让 GCC 做得更好吗?
编辑:这是 Mac OS 上 clang 4.2 的结果:
慢():
movq _aa@GOTPCREL(%rip), %rax ; rax = aa (both ints at once)
movq _bb@GOTPCREL(%rip), %rcx ; rcx = bb
movq _mode@GOTPCREL(%rip), %rdx ; rdx = mode
cmpl $0, (%rdx) ; mode == 0 ?
leaq 4(%rcx), %rdx ; rdx = bb[1]
cmovneq %rax, %rcx ; if (mode != 0) rcx = aa
leaq 4(%rax), %rax ; rax = aa[1]
cmoveq %rdx, %rax ; if (mode == 0) rax = bb
movl (%rax), %eax ; eax = xx[1]
subl (%rcx), %eax ; eax -= xx[0]
快速():
movq _mode@GOTPCREL(%rip), %rax ; rax = mode
cmpl $0, (%rax) ; mode == 0 ?
je LBB1_2 ; if (mode != 0) {
movq _aa@GOTPCREL(%rip), %rcx ; rcx = aa
jmp LBB1_3 ; } else {
LBB1_2: ; // (mode == 0)
movq _bb@GOTPCREL(%rip), %rcx ; rcx = bb
LBB1_3: ; }
movl 4(%rcx), %eax ; eax = xx[1]
subl (%rcx), %eax ; eax -= xx[0]
有趣:clang 为slow() 生成无分支条件,但为fast() 生成一个分支!另一方面,slow() 执行三个加载(其中两个是推测性的,一个是不必要的),而fast() 执行两个。 fast() 实现更“明显”,并且与 GCC 一样,它更短,使用的寄存器更少。
Mac OS 上的 GCC 4.7 通常会遇到与 Linux 相同的问题。然而,它使用与 Mac OS 上的 Clang 相同的“加载 8 个字节然后两次提取 4 个字节”模式。这有点有趣,但不是很相关,因为在 GCC 的任一平台上,使用两个寄存器而不是一个内存和一个寄存器发出 subl 的原始问题是相同的。
【问题讨论】:
-
只是拆解“慢”还是你分析过?这两个版本在现代 CPU 上可能具有相同的性能。由于您使用的是 x86_64,因此您不能使用
-march=来尝试较旧的内核(假设某个基本级别的功能是 64 位的)。 -
这在很大程度上归结于这样一个事实,即尽管编译器擅长优化代码,但它们很少生成最佳代码。毕竟,这是一个 NP 难题。所以很多时候,他们甚至没有尝试生成最佳代码。
-
但是要回答你为什么会发生这种情况的问题,GCC 似乎没有尝试做最后的指令合并。
-
看看clang用它做了什么会很有趣。
-
@John,请注意 gcc 也发出条件移动,但仅在您没有在这里写的 auto0/1 中(至少它对我来说是这样,因为 auto0/1 仍然存在于它们的非内联形式)。似乎当将这段代码内联到慢时,gcc 删除了它(或者一开始就没有写),而 clang 没有 - 也许它与内联发生的阶段有关。你能用 gcc -fearly-inlining 试试吗?
标签: c optimization gcc assembly x86