参考:
优达学城:https://classroom.udacity.com/courses/cs344/lessons/55120467/concepts/670611900923
一、典型GPU程序构成
一个典型GPU程序有如下几个部分:
①CPU在GPU上分配内存
②CPU将CPU中的数据copy到GPU中
③调用内核函数来处理数据
④CPU将GPU中的数据copy到CPU中
*可以看出,四个步骤中有两个是数据的copy,因此如果你的程序需要不断地进行copy,那么运行效率会比较低,不适合利用GPU运算。
一般情况下,最好的方式是,让GPU进行大量运算,同时保证计算量与通信的比值很高。
二、运行程序时GPU是如何运作的?
前面提到,我们将运算看作是一个由一系列或多个内核组成的结构。GPU有很多并行的计算单元,那么当我们写kernels的时候,应该充分利用这些硬件并行。
★Big Idea(one of the very core concept of CUDA):
当你在写程序的时候,你把它写的像是一个串行的程序,就好像是在一个单独的线程里运行一样。当你从CPU调用核的时候,就给核规定好要启动几个线程,每一个线程都会运行这个程序(的一部分?,存疑)。