线程束(warp)
一个GPU由多个SM组成,一个SM上可以放多个线程块,不同线程块之间并行或顺序执行。一个线程块分为多个线程束,一个线程束由32个线程(有连续的线程号)组成。从更细粒度来看,一个SM以一个线程束为单位产生、管理、调度、执行线程。
福特架构之前,每个warp只有一个程序计数器,需要注意分支发散问题。一些严重的分支发散会极大降低性能。
从福特架构开始,引入了独立线程调度机制。书里关于这个感觉没有讲的特别明白,没有太搞清楚和分支发散的逻辑关系。
https://baijiahao.baidu.com/s?id=1567082220106634&wfr=spider&for=pc
https://blog.csdn.net/javastart/article/details/117371228
读完大概明白了,加入了独立线程调度机制后,可以允许线程的同步和通信,粒度更细,操作更灵活。会牺牲一点寄存器。并没有使分支分散变快或怎么样。
福特架构之前:__synthreads()可以使线程块同步
福特架构及之后:__synwarp()线程束内同步。原型为void __synwarp(unsigned mask=oxffffffff),全1表示所有线程同步。这个比__synthreads更快。