在cuda中使用tensor core计算GEMM(上)
从CUDA9.0开始就已经支持代码中调用tensor core进行计算,tensor core是NVIDIA的volta架构中新处理单元,分布于各个流处理器(SM)中,其在物理层支持如下形式的运算:其中矩阵乘法中的A,B数据类型必须为FP16,而累加矩阵C和最终输出数据类型可以为FP16也可以为FP32。要在自己的kernel中使用tensor core必须包含头文件mma.h,...
原创
2019-10-12 01:17:19 ·
5905 阅读 ·
6 评论