【问题标题】:gcc x86 Windows stack alignmentgcc x86 Windows 堆栈对齐
【发布时间】:2017-01-04 06:47:17
【问题描述】:

我正在编写一个编译器,纯粹是为了学习。我目前正在通过编译简单的 c++ 代码来学习堆栈帧,然后研究 gcc 4.9.2 为 Windows x86 生成的输出 asm。

我的简单c++代码是

#include <iostream>

using namespace std;

int globalVar;

void testStackStuff(void);
void testPassingOneInt32(int v);
void forceStackFrameCreation(int v);

int main()
{
  globalVar = 0;

  testStackStuff();

  std::cout << globalVar << std::endl;
}

void testStackStuff(void)
{
  testPassingOneInt32(666);
}

void testPassingOneInt32(int v)
{
  globalVar = globalVar + v;

  forceStackFrameCreation(v);
}

void forceStackFrameCreation(int v)
{
  globalVar = globalVar + v;
}

好的,当它使用 -mpreferred-stack-boundary=4 编译时,我期望看到一个与 16 字节对齐的堆栈(从技术上讲,它与 16 字节对齐,但还有额外的 16 字节未使用的堆栈空间)。 gcc 生成的 main 的序言是:

22                      .loc 1 12 0
23                      .cfi_startproc
24 0000 8D4C2404        lea ecx, [esp+4]
25                      .cfi_def_cfa 1, 0
26 0004 83E4F0          and esp, -16
27 0007 FF71FC          push    DWORD PTR [ecx-4]
28 000a 55              push    ebp
29                      .cfi_escape 0x10,0x5,0x2,0x75,0
30 000b 89E5            mov ebp, esp
31 000d 51              push    ecx
32                      .cfi_escape 0xf,0x3,0x75,0x7c,0x6
33 000e 83EC14          sub esp, 20
34                      .loc 1 12 0
35 0011 E8000000        call    ___main
35      00
36                      .loc 1 13 0
37 0016 C7050000        mov DWORD PTR _globalVar, 0
38                      .loc 1 15 0
39 0020 E8330000        call    __Z14testStackStuffv

第 26 行将 esp 向下舍入到最近的 16 字节边界。

第 27、28 和 31 行总共将 12 个字节压入堆栈,然后

第 33 行从 esp 中再减去 20 个字节,总共 32 个字节!

为什么?

第 39 行然后调用 testStackStuff。

注意 - 此调用推送返回地址(4 个字节)。

现在,让我们看一下 testStackStuff 的序言,记住堆栈现在距离下一个 16 字节边界更近了 4 个字节。

67 0058 55              push    ebp
68                      .cfi_def_cfa_offset 8
69                      .cfi_offset 5, -8
70 0059 89E5            mov ebp, esp
71                      .cfi_def_cfa_register 5
72 005b 83EC18          sub esp, 24
73                      .loc 1 22 0
74 005e C704249A        mov DWORD PTR [esp], 666

第 67 行又推了 4 个字节(现在是 8 个字节向边界移动)。

第 72 行又减去了 24 个字节(总共 32 个字节)。

此时堆栈已在 16 字节边界上正确对齐。但是为什么是 2 的倍数呢?

如果我将编译器标志更改为 -mpreferred-stack-boundary=5,我希望堆栈与 32 字节对齐,但 gcc 似乎再次生成与 64 字节对齐的堆栈帧,是我预期数量的两倍。

主线序言

23                      .cfi_startproc
24 0000 8D4C2404        lea ecx, [esp+4]
25                      .cfi_def_cfa 1, 0
26 0004 83E4E0          and esp, -32
27 0007 FF71FC          push    DWORD PTR [ecx-4]
28 000a 55              push    ebp
29                      .cfi_escape 0x10,0x5,0x2,0x75,0
30 000b 89E5            mov ebp, esp
31 000d 51              push    ecx
32                      .cfi_escape 0xf,0x3,0x75,0x7c,0x6
33 000e 83EC34          sub esp, 52
34                      .loc 1 12 0
35 0011 E8000000        call    ___main
35      00
36                      .loc 1 13 0
37 0016 C7050000        mov DWORD PTR _globalVar, 0
37      00000000 
37      0000
38                      .loc 1 15 0
39 0020 E8330000        call    __Z14testStackStuffv

第 26 行将 esp 向下舍入到最近的 32 字节边界

第 27、28 和 31 行总共将 12 个字节压入堆栈,然后

第 33 行从 esp 中再减去 52 个字节,总共 64 个字节!

testStackStuff 的序幕是

66                      .cfi_startproc
67 0058 55              push    ebp
68                      .cfi_def_cfa_offset 8
69                      .cfi_offset 5, -8
70 0059 89E5            mov ebp, esp
71                      .cfi_def_cfa_register 5
72 005b 83EC38          sub esp, 56
73                      .loc 1 22 0

(堆栈上的 4 个字节来自)调用 __Z14testStackStuffv

(堆栈上的 4 个字节来自)push ebp

(堆栈上的 56 个字节来自)sub esp,56

总共 64 个字节。

有人知道为什么 gcc 会创建这个额外的堆栈空间还是我忽略了一些明显的东西?

感谢您提供的任何帮助。

【问题讨论】:

  • 但 gcc 似乎再次生成对齐到 64 字节的堆栈帧。不,它使用了and esp, -32。堆栈帧大小看起来像 64 字节,但它的对齐方式只有 32B。
  • 相关:stackoverflow.com/questions/38781118/… 解释了push DWORD PTR [ecx-4] 部分。

标签: c++ x86 stack alignment frame


【解决方案1】:

为了解开这个谜团,您需要查看 gcc 的文档以准确了解它使用的 Application Binary Interface (ABI) 风格,然后查找那个 ABI 并阅读它。如果您“正在编写一个纯粹作为学习经验的编译器”,那么您肯定会需要它。

简而言之,从广义上讲,ABI 要求当前函数保留这个额外的空间,以便将参数传递给当前函数调用的函数。保留多少空间的决定主要取决于函数打算传递的参数量,但它比这更细微,ABI是详细解释它的文档

在旧式堆栈帧中,我们会将PUSH 参数传递给堆栈,然后调用一个函数。

在新的堆栈帧样式中,不再使用 EBP,(不知道为什么它会被保留并从 ESP 复制,)参数被放置在堆栈中相对于ESP 的特定偏移处,然后该函数被调用。事实证明,mov DWORD PTR [esp], 666 用于将 666 参数传递给调用 testPassingOneInt32(666);。

【讨论】:

  • 确实有道理,网络上到处都是使用带有偏移量的 EBP 来访问本地变量和自动变量的示例。我会去寻找 ABI 并在阅读后发布更多信息。完成后,我会将您的回复标记为正确答案。
【解决方案2】:

为什么要使用push DWORD PTR [ecx-4] 来复制返回地址,请参阅this partial duplicate。 IIRC,它正在构建返回地址/保存的 ebp 对的完整副本。


但 gcc 似乎再次生成对齐到 64 字节的堆栈帧

不,它使用了and esp, -32。堆栈帧大小看起来像 64 字节,但它的对齐方式只有 32B。

我不确定为什么它会在堆栈框架中留下这么多额外空间。猜测为什么 gcc -O0 会这样做并不是很有趣,因为它甚至没有试图达到最佳状态。

显然你编译时没有优化,这让整个事情变得不那么有趣了。这会告诉你更多关于 gcc 的内部结构以及 gcc 的便利之处,而不是它发出的代码是必要的或做任何有用的事情。此外,使用http://gcc.godbolt.org/ 可以在没有 CFI 指令和其他噪音的情况下获得良好的 asm 输出。 (请用它的输出整理问题中的 asm 代码块。所有的噪音使它们更难阅读。)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2014-03-11
    • 1970-01-01
    • 2021-12-16
    • 2011-02-15
    • 1970-01-01
    • 2013-01-30
    • 2010-10-24
    • 1970-01-01
    相关资源
    最近更新 更多