- 博客(5)
- 收藏
- 关注
翻译 CUDA 编程模型详解:Grid / Block / Warp / Thread 层级与 GPU 内存体系
CUDA编程模型学习笔记 本文是NVIDIA CUDA编程指南的学习笔记,重点介绍了CUDA的核心编程模型。 主要概念 异构系统:CUDA程序在CPU(host)和GPU(device)上协同工作。CPU负责启动kernel和数据传输,GPU执行并行计算。 线程层级: thread → thread block → grid 新增cluster层级(CC 9.0+),允许同一GPC内的多个blocks协同工作 执行模型: SIMT(单指令多线程)执行方式 32个线程组成一个warp,同一warp内的线程执行
2026-06-02 14:37:25
52
原创 GPU 核心执行单元 SM 入门:一条指令在 Turing SM 里怎么流动
本文以 NVIDIA Turing / TU102 SM(Streaming Multiprocessor)架构 为例,梳理一个 CUDA kernel 在 SM 内部的基本执行路径:从 Warp Scheduler 选择 ready warp,到 Dispatch 将指令分发给 FP32、INT32、Tensor Core、SFU、LD/ST 等执行管线,再到 Register File、L1 Data Cache / Shared Memory 和 Texture/RT Core 等单元如何协作。
2026-05-25 16:59:44
368
原创 从 TU106(Turing)读懂 GPU:制程/Die与晶体管,以及 GDDR6 显存带宽怎么读
把 GPU 工艺的 nm / mm² / B(transistor) 说人话,并教会你看懂 GDDR6:位宽、Gbps、带宽。
2026-05-25 10:50:14
424
原创 GPU 片上分层速查:TU102 Full Chip Diagram 与外设—计算—后端显存链路
以 TU102 整芯片图为线索,按 Host→PCIe→GigaThread→GPC→TPC→SM→L2/MC→显存的链路分层读框图,厘清系统入口与片上分发、执行、访存后端的关系,可与 SM 微观笔记串联。
2026-05-22 15:47:26
370
原创 GPU 卡片信息怎么整理:以我这块 TU106 移动版为例
以 TU106 移动版 Quadro(30 SM) 为例,归纳 CUDA 数量、 GDDR6 位宽与带宽、Max‑Q 频率语义、PCIe 空闲与工作协商,并注明与 full TU106 die 的差异,可作 GPU 学习与后续 CUDA 实践的规格底稿。
2026-05-22 15:25:24
321
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅