CUDA学习日志：入门例程和编程接口

最新推荐文章于 2023-06-03 09:23:49 发布

Lin-JM

最新推荐文章于 2023-06-03 09:23:49 发布

阅读量3.9k

点赞数

分类专栏：图像处理与分析文章标签： cuda LinJM

本文链接：https://blog.csdn.net/linj_m/article/details/41345263

版权

本文是CUDA学习系列的一部分，介绍了CUDA编程的基本概念，如主机与设备的区别、核函数、内建变量、内存管理和同步。通过一个简单的向量加法例子，展示了如何在GPU上执行函数以及理解CUDA代码与C/C++的不同。文章还详细解释了__global__、blockIdx等概念，并提到了cudaMalloc、cudaFree和cudaMemcpy等内存管理函数的用法。

摘要由CSDN通过智能技术生成

接触CUDA的时间并不长，最开始是在cuda-convnet的代码中接触CUDA代码，当时确实看的比较痛苦。最近得空，在图书馆借了本《GPU高性能编程 CUDA实战》来看看，同时也整理一些博客来加强学习效果。

Jeremy Lin

上篇博文我们主要是介绍了CUDA开发环境的配置和一些学习资源。现在我们正式进入CUDA的学习。如果你还记得上篇最后有一个“Hello World”的例子，你会发现它和C程序根本没什么差。不过，从这个Hello World我们来引出CUDA编程的一个重要区别：我们将CPU以及系统的内存称为主机(host)，而将GPU及其内存称为设备(device)。而上篇的Hello World和我们以前写过的代码没啥差别的原因在于它并不考虑主机之外的任何计算设备。

现在我们来看看如何使用设备(device)来执行代码。在GPU设备上执行的函数，我们通常称为核函数(kernel)。

首先，Show the Code：

#include "cuda_runtime.h"
#include <stdio.h>

const int N = 10;

__global__ void add_Jeremy(int*a, int*b, int*c)
{
	int tid = blockIdx.x;
	if (tid < N)
	{
		c[tid] = a[tid] + b[tid];
	}
}

int main()
{
	int a[N], b[N], c[N];
	int *dev_a, *dev_b, *dev_c;

	cudaMalloc((void**)&dev_a, N*sizeof(int));
	cudaMalloc((void**)&dev_b, N*sizeof(int));
	cudaMalloc((void**)&dev_c, N*sizeof(int));

	for (int i = 0; i < N; i++)
	{
		a[i] = -i;
		b[i] = i * i;
	}

	cudaMemcpy(dev_a, a, N*sizeof(int), cudaMemcpyHostToDevice);
	cudaMemcpy(dev_b, b, N*sizeof(int), cudaMemcpyHostToDevice);

	add_Jeremy<<<N,1>>>(dev_a, dev_b, dev_c);

	cudaMemcpy(c, dev_c, N*sizeof(int), cudaMemcpyDeviceToHost);

	for (int i = 0; i < N; i++)
	{
		printf("%d + %d = %d\n", a[i], b[i], c[i]);
	}

	cudaFree(dev_a);
	cudaFree(dev_b);
	cudaFree(dev_c);

	return