正如其他人所说,您正在查看 Microsoft 的编译器文档,该编译器的内联汇编形式与 GCC 使用的汇编形式截然不同。事实上,it is a substantially less powerful form 在很多方面,虽然它确实具有更容易学习使用的优点。
您需要查阅有关 Gnu 内联汇编语法的文档,该文档可在 here 获得。更温和的介绍,有一个很好的教程here,我特别喜欢David Wohlferd 的回答here。尽管这是一个不相关的问题,但如果您只是按照他的解释进行操作,他就会很好地介绍内联汇编的基础知识。
无论如何,针对您的具体问题。几个迫在眉睫的问题:
-
代码很可能不会像您认为的那样做。您的代码实际上所做的是将 pi 添加到flp2_num,然后将结果放入flp_rslt1。它对flp1_num 没有任何作用。
如果我不得不猜测,我会假设您想将flp1_num、pi 和flp2_num 加在一起,然后在flp_rslt1 中返回结果。 (但也许不是;这不是很清楚,因为您没有任何 cmets 说明您的意图,也没有描述性的函数名称。)
您的代码也损坏,因为它没有正确清理浮点堆栈。您有两个“加载”指令,但没有弹出指令!您推送/加载到浮点堆栈的所有内容都必须弹出/卸载,否则您会导致浮点堆栈不平衡,这会导致重大问题。
因此,在 MSVC 语法中,您的代码应该如下所示(为了方便和清晰,将其包装成一个函数):
float SumPlusPi(float flp1_num, float flp2_num)
{
float flp_rslt1;
__asm
{
fldpi ; load the constant PI onto the top of the FP stack
fadd DWORD PTR [flp2_num] ; add flp2_num to PI, and leave the result on the top of the stack
fadd DWORD PTR [flp1_num] ; add flp1_num to the top of the stack, again leaving the result there
fstp DWORD PTR [flp_rslt1] ; pop the top of the stack into flp_rslt1
}
return flp_rslt1;
}
我只推了一次(fldpi),所以我只弹出了一次(fstp)。对于添加,我使用了fadd 的形式,它适用于内存操作数;这会导致该值被隐式加载到堆栈上,但在其他方面似乎作为单个指令执行。然而,你可以用许多不同的方式来写这个。重要的是要平衡推送次数和弹出次数。有些指令显式弹出 (fstp),还有其他指令执行操作然后弹出 (例如、faddp)。不同的指令组合,按照特定的顺序,很可能比其他指令更优化,但我上面的代码确实有效。
下面是翻译成 GAS 语法的等效代码:
float SumPlusPi(float flp1_num, float flp2_num)
{
float flp_rslt1;
__asm__("fldpi \n\t"
"faddl %[two] \n\t"
"faddl %[one]"
: [result] "=t" (flp_rslt1) // tell compiler result is left at the top of the floating-point stack,
// making an explicit pop unnecessary
: [one] "m" (flp1_num), // input operand from memory (inefficient)
[two] "m" (flp2_num)); // input operand from memory (inefficient)
return flp_rslt1;
}
虽然这可行,但它也不是最理想的,因为它没有利用 GAS 内联汇编语法的高级功能,特别是使用已经加载到浮点堆栈中的值作为输入的能力。
不过,最重要的是,不要错过the reasons why you should not use inline assembly(也是 David Wohlferd 的)!这是内联汇编的真正毫无意义的用法。 编译器会生成更好的代码,并且您需要显着减少工作。因此,最好像这样编写上述函数:
#include <cmath> // for M_PI constant
float SumPlusPi(float flp1_num, float flp2_num)
{
return (flp1_num + flp2_num + static_cast<float>(M_PI));
}
请注意,如果您确实想要实现与我之前假设不同的逻辑,那么更改此代码以执行您想要的操作是微不足道的。
如果您不相信我生成的代码与您的内联汇编一样好——如果不是更好——这里是 GCC 6.2 为上述函数生成的确切目标代码 ( Clang 发出相同的代码):
fld DWORD PTR [flp2_num] ; load flp2_num onto top of FPU stack
fadd DWORD PTR [flp1_num] ; add flp1_num to value at top of FPU stack
fadd DWORD PTR [M_PI] ; add constant M_PI to value at top of FPU stack
ret ; return, with result at top of FPU stack
使用fldpi 与像 GCC 一样从常量加载值并没有速度上的优势。如果有的话,强制使用该指令实际上是一种悲观,因为这意味着您的代码永远无法利用 SSE/SSE2 指令来比旧的 x87 更有效地处理浮点值远 FPU。为上述 C 代码启用 SSE/SSE2 就像抛出编译器开关(或指定支持它的目标架构,这将隐式启用它)一样简单。这将为您提供以下信息:
sub esp, 4 ; reserve space on the stack
movss xmm0, DWORD PTR [M_PI] ; load M_PI constant
addss xmm0, DWORD PTR [flp2_num] ; add flp2_num
addss xmm0, DWORD PTR [flp1_num] ; add flp1_num
movss DWORD PTR [esp], xmm0 ; store result in temporary space on stack
fld DWORD PTR [esp] ; load result from stack to top of FPU stack
add esp, 4 ; clean up stack space
ret ; return, with result at top of FPU stack