自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(5)
  • 收藏
  • 关注

翻译 CUDA 编程模型详解:Grid / Block / Warp / Thread 层级与 GPU 内存体系

CUDA编程模型学习笔记 本文是NVIDIA CUDA编程指南的学习笔记,重点介绍了CUDA的核心编程模型。 主要概念 异构系统:CUDA程序在CPU(host)和GPU(device)上协同工作。CPU负责启动kernel和数据传输,GPU执行并行计算。 线程层级: thread → thread block → grid 新增cluster层级(CC 9.0+),允许同一GPC内的多个blocks协同工作 执行模型: SIMT(单指令多线程)执行方式 32个线程组成一个warp,同一warp内的线程执行

2026-06-02 14:37:25 52

原创 GPU 核心执行单元 SM 入门:一条指令在 Turing SM 里怎么流动

本文以 NVIDIA Turing / TU102 SM(Streaming Multiprocessor)架构 为例,梳理一个 CUDA kernel 在 SM 内部的基本执行路径:从 Warp Scheduler 选择 ready warp,到 Dispatch 将指令分发给 FP32、INT32、Tensor Core、SFU、LD/ST 等执行管线,再到 Register File、L1 Data Cache / Shared Memory 和 Texture/RT Core 等单元如何协作。

2026-05-25 16:59:44 368

原创 从 TU106(Turing)读懂 GPU:制程/Die与晶体管,以及 GDDR6 显存带宽怎么读

把 GPU 工艺的 nm / mm² / B(transistor) 说人话,并教会你看懂 GDDR6:位宽、Gbps、带宽。

2026-05-25 10:50:14 424

原创 GPU 片上分层速查:TU102 Full Chip Diagram 与外设—计算—后端显存链路

以 TU102 整芯片图为线索,按 Host→PCIe→GigaThread→GPC→TPC→SM→L2/MC→显存的链路分层读框图,厘清系统入口与片上分发、执行、访存后端的关系,可与 SM 微观笔记串联。

2026-05-22 15:47:26 370

原创 GPU 卡片信息怎么整理:以我这块 TU106 移动版为例

以 TU106 移动版 Quadro(30 SM) 为例,归纳 CUDA 数量、 GDDR6 位宽与带宽、Max‑Q 频率语义、PCIe 空闲与工作协商,并注明与 full TU106 die 的差异,可作 GPU 学习与后续 CUDA 实践的规格底稿。

2026-05-22 15:25:24 321 1

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除