Cuda编程结构《1》

最新推荐文章于 2022-10-10 21:16:56 发布

seven不是程序猿

最新推荐文章于 2022-10-10 21:16:56 发布

阅读量221

点赞数

分类专栏： cuda编程学习笔记

本文链接：https://blog.csdn.net/u012170326/article/details/72378256

版权

学习笔记同时被 2 个专栏收录

16 篇文章 0 订阅

订阅专栏

cuda编程

1 篇文章 0 订阅

订阅专栏

因为研一的课程里面有高性能计算这门课，没办法，为了不让上课成为苦恼的工作，只能认真学，还好CUDA变成对于我来说也不算陌生，那么我也记录下我的学习过程，为后来的同学铺垫一下。

学习编程就必须要知道CUDA程序到底是怎么一个执行过程。好的，这一节在介绍流之前，先把CUDA程序结构简要说一下。
CUDA程序文件后缀为.cu，有些编译器可能不认识这个后缀的文件，我们可以在VS2008的Tools->Options->Text Editor->File Extension里添加cu后缀到VC++中。
一个.cu文件内既包含CPU程序（称为主机程序），也包含GPU程序（称为设备程序）。如何区分主机程序和设备程序？根据声明，凡是挂有“global”或者“device”前缀的函数，都是在GPU上运行的设备程序，不同的是global设备程序可被主机程序调用，而device设备程序则只能被设备程序调用。
没有挂任何前缀的函数，都是主机程序。主机程序显示声明可以用host前缀。设备程序需要由NVCC进行编译，而主机程序只需要由主机编译器（如VS2008中的cl.exe，Linux上的GCC）。主机程序主要完成设备环境初始化，数据传输等必备过程，设备程序只负责计算。
主机程序中，有一些“cuda”打头的函数，这些都是CUDA Runtime API，即运行时函数，主要负责完成设备的初始化、内存分配、内存拷贝等任务。我们编程中会用到的函数 cudaGetDeviceCount()，cudaGetDeviceProperties()，cudaSetDevice()都是运行时API。这些函数的具体参数声明我们不必一一记下来，拿出第三节的官方利器就可以轻松查询。
流并行：
线程并行为细粒度的并行，而块并行为粗粒度的并行，同时也知道CUDA的线程组织情况，即Grid-Block-Thread结构。一组线程并行处理可以组织为一个block，而一组block并行处理可以组织为一个Grid，很自然地想到，Grid只是一个网格，我们是否可以利用多个网格来完成并行处理呢？答案就是利用流。
CUDA中的流用cudaStream_t类型实现，用到的API有以下几个：cudaStreamCreate(cudaStream_t * s)用于创建流，cudaStreamDestroy(cudaStream_t s)用于销毁流，cudaStreamSynchronize()用于单个流同步，cudaDeviceSynchronize()用于整个设备上的所有流同步，cudaStreamQuery()用于查询一个流的任务是否已经完成。具体的含义可以查询API手册。
下面我们将VS案例中的任务改用流实现，仍然是{1,2,3,4,5}+{10,20,30,40,50} = {11,22,33,44,55}这个例子：

seven不是程序猿

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Cuda编程结构《1》

因为研一的课程里面有高性能计算这门课，没办法，为了不让上课成为苦恼的工作，只能认真学，还好CUDA变成对于我来说也不算陌生，那么我也记录下我的学习过程，为后来的同学铺垫一下。学习编程就必须要知道CUDA程序到底是怎么一个执行过程。好的，这一节在介绍流之前，先把CUDA程序结构简要说一下。 CUDA程序文件后缀为.cu，有些编译器可能不认识这个后缀的文件，我们可以在VS2008的To
复制链接

扫一扫