C代码调用汇编&使用指令集优化

  最近研究x264汇编代码,感觉使用到的优化思想和手法非常不错,在此写一个demon来记录我学习过程

  • 从搭建环境开始

  x264使用汇编优化的思想是将汇编代码编译到一个静态库里,供C代码调用,所以首先需要构建一个汇编函数得静态库。因为手动配置使用yasm来编译汇编文件,并生成一个lib相当麻烦,我选择的是使用cmake来构建。

  在demon里有一个sum.asm的汇编文件,文件里是所有的汇编函数,通过yasm编译后生成sum.obj,然后通过sum.obj来创建一个sum.lib库供C代码使用。还有一个main。c的C文件,用来生成可执行文件main,CMakeLists.txt文件如下:

cmake_minimum_required(VERSION 3.0.00)

project (asm)

find_program(YASM_EXECUTABLE 
    NAMES yasm yasm-1.2.0-win32 yasm-1.2.0-win64
    HINTS $ENV{YASM_ROOT} ${YASM_ROOT}
    PATH_SUFFIXES bin
)
set(FLAGS -f win64 -DARCH_X86_64=1)
add_custom_command(
        OUTPUT sum.obj
        COMMAND ${YASM_EXECUTABLE}  ARGS ${FLAGS} ../source/sum.asm -o sum.obj
        DEPENDS sum.asm)

#添加静态库sum add_library( sum STATIC sum.obj sum.asm ) set_target_properties(sum PROPERTIES LINKER_LANGUAGE C)

#添加使用静态库的可执行程序main
add_executable( main main.c )
target_link_libraries(main sum )

  其中find_program是在系统环境变量中寻找看是否有yasm汇编器,在此假设是有的。

  需要注意的是在COMMAND ${YASM_EXECUTABLE} ARGS ${FLAGS} ../source/sum.asm -o sum.obj中指定汇编文件的路径得是相对与工程文件所在的相对路径,所以这里是../source/sum.asm

  至此环境搭建完毕,使用cmake就能生成需要的汇编lib工程和调用汇编函数得可执行文件工程。在vs上如下图所示

  

  •  关于汇编

  先写一个最简单的例子(在此针对的是64bit汇编),假设main函数里需要对两个数字求和,代码如下:

1 int sum(int a, int b);//此函数通过汇编实现
2 
3 int main(int argc, char *argv[])
4 {
5     int num = sum(2, 3);
6     return 0;
7 }

  那麽对应的汇编实现sum函数的代码如下:

1 global sum
2 
3 sum:
4 
5     add ecx, edx ;直接使用ecx和edx寄存器中的参数
6     mov eax, ecx
7 
8     ret

   这是一个最简单的C调用汇编函数得demon,在写汇编函数的时候碰到了以下问题:

  1. 之前学习的都是32位汇编的时候,函数参数的传递都是通过栈来完成的,在64位汇编中,前四个参数是通过寄存器rcx、rdx、r8、r9来传递的,只有参数个数大于4个后才通过栈来传递,所在在以上汇编代码中直接使用了寄存器ecx和edx中的值

  当函数参数个数大于4时,假设C代码如下:

1 int sum(int a, int b, int c, int d, int e);
2 
3 int main(int argc, char *argv[])
4 {
5     int num = sum(2, 3, 4, 5, 6);
6     return 0;
7 }

  对应的汇编代码如下:

 1 global sum
 2 
 3 sum:
 4 
 5     add rcx, rdx
 6     add rcx, r8
 7     add rcx, r9
 8 
 9     mov rdx, [rsp + 40] ;从栈中取出第5个参数放入rdx寄存器
10     add rcx, rdx
11 
12     mov rax, rcx
13 
14     ret

  此处需要注意的是:前四个参数是通过寄存器传递,从栈中取出第五个参数时,并不是从rsp+8的地方取,而是从rsp+40(40 = 4*8 + 8)的地方取,说明虽然前四个参数是通过寄存器传递,但是在栈中还是占用了相应的空间,我对此的理解是为了__stdcall和__cdecll的兼容吧。

  • 使用指令集优化(SSE AVX等)

  首先来看一下SIMD寄存器

 

 

  SSE使用到的SIMD寄存器是128bit,一共有16个,从XMM0到XMM15

  AVX拓展出来的SIMD寄存器是256bit,一共也是16个,从YMM0到YMM16,当然AVX也能使用SSE的XMM寄存器

  AVX2.0的时候将寄存器拓展到了512bit,一共有32个,从ZMM0到ZMM31

  假设我们的main函数是对两个数组进行求和,代码如下:

 1 #define N 8
 2 
 3 int sum(float a[], float b[]);
 4 
 5 int sum_c(float a[], float b[])
 6 {
 7     for (int i = 0; i < N; i++)
 8     {
 9         a[i] += b[i];
10     }
11     return 0;
12 }
13 
14 int main(int argc, char *argv[])
15 {
16     float a[N] = { 2.0, 3.0, 4.0, 5.0, 6.0, 7.0, 8.0, 9.0 };
17     float b[N] = { 1.0, 2.0, 3.0, 4.0, 5.0, 6.0, 7.0, 8.0 };
18     //将数组b[N]中的数据加到数组a[n]中
19     sum_c(a, b);//不使用汇编优化
20     sum(a, b);//使用汇编优化
21     return 0;
22 }

  可以看到,不使用汇编优化的话,在sum_c函数中,我们需要依次计算出a[i] + b[i]的和并保存在a[i]中。

  如果使用SSE指令集优化的话,代码如下:

 1 global sum
 2 
 3 sum:
 4 
 5     movups xmm0, [rcx]
 6     movups xmm1, [rdx]
 7     movups xmm2, [rcx + 16]
 8     movups xmm3, [rdx + 16]
 9 
10     addps xmm0, xmm1
11     addps xmm2, xmm3
12 
13     movups [rcx], xmm0
14     movups [rcx + 16], xmm2
15     
16     ret

  可以看到,只需要进行两次加法运算就能计算出a[8]和b[8]中8个数字相加的和,这里需要进行两次计算是因为xmm寄存器是128bit,所以每次只能计算4个float数据,8个数据得分两次计算。

  使用AVX指令集优化代码如下:

 1 global sum
 2 
 3 sum:
 4 
 5     vmovups ymm1, [rcx]
 6     vmovups ymm2, [rdx]
 7 
 8     vaddps ymm0, ymm1, ymm2
 9     vmovups [rcx], ymm0
10     
11     ret

  因为AVX使用到了256bit的ymm寄存器,所以一次可以处理8个32bit的float数据,一次计算就能完成两组8个float数据分别的求和操作。

 

转载于:https://www.cnblogs.com/JeroZeng/p/4782438.html

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
提供的源码资源涵盖了安卓应用、小程序、Python应用和Java应用等多个领域,每个领域都包含了丰富的实例和项目。这些源码都是基于各自平台的最新技术和标准编写,确保了在对应环境下能够无缝运行。同时,源码中配备了详细的注释和文档,帮助用户快速理解代码结构和实现逻辑。 适用人群: 这些源码资源特别适合大学生群体。无论你是计算机相关专业的学生,还是对其他领域编程感兴趣的学生,这些资源都能为你提供宝贵的学习和实践机会。通过学习和运行这些源码,你可以掌握各平台开发的基础知识,提升编程能力和项目实战经验。 使用场景及目标: 在学习阶段,你可以利用这些源码资源进行课程实践、课外项目或毕业设计。通过分析和运行源码,你将深入了解各平台开发的技术细节和最佳实践,逐步培养起自己的项目开发和问题解决能力。此外,在求职或创业过程中,具备跨平台开发能力的大学生将更具竞争力。 其他说明: 为了确保源码资源的可运行性和易用性,特别注意了以下几点:首先,每份源码都提供了详细的运行环境和依赖说明,确保用户能够轻松搭建起开发环境;其次,源码中的注释和文档都非常完善,方便用户快速上手和理解代码;最后,我会定期更新这些源码资源,以适应各平台技术的最新发展和市场需求。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值