cuda
文章平均质量分 91
KIDGINBROOK
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
DeepGEMM Mega MoE(一)- 整体流程及Blackwell的block scaling
DeepSeek V4在DeepGEMM中引入了Mega MoE大算子,融合了dispatch/linear 1/SwiGLU/linear 2/combine,本节主要介绍一下整体流程和Blackwell的block scaling。原创 2026-04-25 11:02:36 · 776 阅读 · 0 评论 -
DeepGEMM学习(一)- Hopper架构的MoE
DeepGEMM是deepseek团队开源的GEMM算子库,支持normal以及MoE,normal为常规GEMM,group contiguous为prefill阶段的MoE,group masked为decode阶段的MoE。原创 2026-03-03 19:22:30 · 714 阅读 · 0 评论 -
Blackwell架构学习
最近学习了一下Blackwell相关的架构,本文整理一下,最大的感受是看到GPU越来越NPU。首先约定一下后续的符号,假设TensorCore处理的D = A x B + D,A和B为bf16,D为fp32。原创 2026-01-13 21:01:07 · 2087 阅读 · 0 评论 -
Hopper Gemm优化
本章介绍下Hopper下TensorCore的使用,以及如何利用TensorCore实现和优化Gemm,主要参考这个博客和对应的代码实现。代码实现了C = A x B,均为bf16,A是K Major,shape为MxK,B为K Major,shape为NxK,C为M Major,shape为NxM。原创 2025-12-17 22:31:48 · 1333 阅读 · 0 评论 -
flash attention 2论文学习
flash attention作者Tri Dao发布了flash attention 2,性能为flash attention的2倍。原创 2023-07-25 22:16:57 · 1894 阅读 · 0 评论 -
flash attention论文及源码学习
flash attention考虑到IO的影响,重新设计了attention算法流程,降低对HBM的占用和访问,在高速缓存上使用block粒度的softmax tiling的计算方法加速attention的计算。原创 2023-07-01 11:30:05 · 8420 阅读 · 22 评论
分享