GPU利用率不高问题记录

最新推荐文章于 2023-03-27 18:46:39 发布

cyz0202

最新推荐文章于 2023-03-27 18:46:39 发布

阅读量3.6k

点赞数 1

分类专栏：技术问题文章标签： GPU利用率

原文链接：https://blog.csdn.net/WYXHAHAHA123/article/details/86596981

版权

技术问题专栏收录该内容

56 篇文章 0 订阅

订阅专栏

以下引用记录来自此blog

上次被老板教授了好久，出现西安卡利用率一直很低的情况千万不能认为它不是问题，而一定要想办法解决。比如可以在加载训练图像的过程中（__getitem__方法中）设定数据增强过程中每个步骤的时间点，对每个步骤的时间点进行打印，判断花费时间较多的是哪些步骤，然后尝试对代码进行优化，因为torhc.utils.data中的__getitem__方法是由CPU上的一个num_workers执行一遍的，如果__getitem__方法执行太慢，则会导致IO速度变慢，即GPU在大多数时间都处于等待CPU读取数据并处理成torch.cuda.tensor的过程，一旦CPU读取一个batch size的数据完毕，GPU很快就计算结束，从而看到的现象是：GPU在绝大多数时间都处于利用率很低的状态。所以我总结的是，如果GPU显卡利用率比较低，最可能的就是CPU数据IO耗费时间太多（我之前就是由于数据增强的裁剪过程为了裁剪到object使用了for循环，导致这一操作很耗时间），还有可能的原因是数据tensor或者模型model根本就没有加载到GPU cuda上面。其实还有一种可能性很小的原因就是，在网络前向传播的过程中某些特殊的操作对GPU的利用率不高，当然指的是除了网络（卷积，全连接）操作之外的其他的对于tensor的操作，比如我之前的faster R-CNN显卡利用率低就是因为RPN中的NMS算法速度太慢，大约2-3秒一张图，虽然这时候tensor特征图在CUDA上面，而且NMS也使用了CUDA kernel编译后的代码，也就是说NMS的计算仍然是利用的CPU（此处个人觉得应该是GPU），但是由于NMS算法并行度不高，所以对于GPU的利用不多，导致了显卡利用率低，之前那个是怎么解决的呢？哈哈，说到底还是环境的问题非常重要，之前的faster R-CNN代码在python2 CUDA9.0 pytorch 0.4.0 环境下编译成功我就没有再仔细纠结环境问题，直接运行了，直到后来偶然换成python3 CUDA9.0 pytorch 0.4.1 环境才极大地提高了显卡利用率，并且通过设置了几十个打印时间点之后发现，真的就是NMS的速度现在基本能维持在0.02-0.2数量级范围内。