- 博客(832)
- 资源 (14)
- 收藏
- 关注
原创 大模型推理引擎vLLM(35):vllm中pp8 tp2的性能prof简单分析记录
大模型推理引擎vLLM(35):vllm中pp8 tp2的性能prof简单分析记录
2026-08-17 17:24:13
213
原创 大模型推理引擎vLLM(31):vllm和vllm026_Kimi K3四条 MoE 路径下分别使用的什么激活函数算子(Triton/AITER/DeepEP-HT/DeepEP-LL)
大模型推理引擎vLLM(31):vllm和vllm026_Kimi K3四条 MoE 路径下分别使用的什么激活函数算子(Triton/AITER/DeepEP-HT/DeepEP-LL)
2026-08-08 11:17:08
203
原创 AI理论知识系统复习(3):GQA(Grouped Query Attention)、MQA(Multi-Query Attention)以及与MHA的区别
AI理论知识系统复习(3):GQA(Grouped Query Attention)、MQA(Multi-Query Attention)以及与MHA的区别
2026-08-02 10:18:09
43
原创 大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
2026-07-29 11:12:47
277
原创 大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理
大模型权重的B/T参数量、显存估算、MoE与Dense模型加载区别以及EP相关问题整理
2026-07-27 11:15:23
379
原创 大模型推理引擎vLLM(29): 重构vllm021中EP高吞吐代码,消除空泡问题:400us减小到25us
大模型推理引擎vLLM(30): 参考sglang代码,重构vllm021中MOE EP高吞吐代码,消除空泡问题:400us减小到25us
2026-07-23 14:01:54
230
原创 大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)
大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)
2026-07-13 15:11:37
327
原创 大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读
大模型推理引擎vLLM(21): vllm0.21.0中EP基类代码modular_kernel.py详细走读
2026-07-12 16:12:20
239
原创 大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异
大模型推理引擎vLLM(27): TP场景moe与EP场景MOE的相同点和不同点、使用modular_kernel.py的差异
2026-07-10 10:20:44
268
原创 DeepEP中的对称堆、rocSHMEM、RDMA buffer相关问题整理
DeepEP中的对称堆、rocSHMEM、RDMA buffer相关问题整理
2026-07-09 13:59:28
272
原创 vllm021中EPLB劣化问题原因排查:默认用torch Gloo而非NCCL搬运权重导致空泡
vllm021中EPLB劣化问题原因排查:默认用torch Gloo而非NCCL搬运权重导致空泡
2026-07-07 15:22:02
199
原创 大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段
大模型推理引擎vLLM(25): 从--kv-cache-dtype fp8_e5m2时gsm8k答非所问的bug梳理kv cache相应代码片段
2026-06-02 16:27:26
428
原创 大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理
大模型推理引擎vLLM(22):怎么添加一个CLI参数以及命令行参数的解析、传递链路代码梳理
2026-05-26 16:54:59
506
原创 cudart、cublas、cutlass、triton、marlin、aiter、deepgemm、llm-compressor名词解释以及和vllm代码的关系
cudart、cublas、cutlass、triton、marlin、aiter、deepgemm、llm-compressor名词解释以及和vllm代码的关系
2026-05-07 14:26:42
521
原创 大模型推理引擎vLLM(32):MOE层相关代码流程梳理_权重重排、量化、GEMM计算、EP、vllm serve命令的解析过程
大模型推理引擎vLLM(20):MOE层相关代码流程梳理_权重重排、量化、GEMM计算、EP
2026-05-02 17:59:06
540
原创 大模型推理引擎vLLM(19): vLLM中的DBO(Dual Batch Overlap)功能代码实现分析
大模型推理引擎vLLM(19): vLLM中的DBO(Dual Batch Overlap)功能代码实现分析
2026-03-24 20:24:49
588
原创 大模型推理引擎vLLM(18): vLLM中的SBO(single batch overlapping)功能代码实现分析
大模型推理引擎vLLM(18): vLLM中的SBO(single batch overlapping)功能代码实现分析
2026-03-09 11:57:12
612
原创 大模型推理引擎vLLM(17): vllm015中model_executor/layers/fused_moe/modular_kernel.py代码阅读笔记
大模型推理引擎vLLM(17): vllm/vllm/model_executor/layers/fused_moe/modular_kernel.py代码阅读笔记
2026-03-05 16:51:21
544
原创 大模型推理引擎vLLM(16): vLLM V1 架构与推理流程学习笔记
大模型推理引擎vLLM(16): vLLM V1 架构与推理流程学习笔记
2026-02-25 17:18:33
1257
原创 大模型推理引擎vLLM(15): Scheduler / Worker整体介绍
大模型推理引擎vLLM(15): Scheduler / Worker整体介绍
2026-02-23 16:10:55
387
原创 大模型推理引擎vLLM(12): vLLM Prefix Caching以及eviction的相关问题和代码
大模型推理引擎vLLM(12): vLLM Prefix Caching以及eviction的相关问题和代码
2026-02-22 16:44:53
859
转载 大模型推理引擎vLLM(7): Chunked-Prefills 分块预填充机制
大模型推理引擎vLLM(7): Chunked-Prefills 分块预填充机制
2026-02-20 09:37:04
648
转载 大模型推理引擎 vLLM (6):Prefix Caching 机制----vLLM哈希方案和SGlang基数树方案
大模型推理引擎 vLLM (6):Prefix Caching 机制----vLLM哈希方案和SGlang基数树方案
2026-02-19 13:55:31
476
原创 大模型推理引擎 vLLM(2):PagedAttention论文学习以及原理解析
大模型推理引擎 vLLM(2):PagedAttention论文学习以及原理解析
2026-01-17 17:11:30
1529
原创 大模型推理引擎vLLM(1): FlashAttention论文以及原理解析
大模型推理引擎vLLM(1): FlashAttention论文以及原理解析
2026-01-10 18:42:39
1115
原创 彻底梳理onnxruntime代码(4):session.Run流程、执行compute_func、模型的re-compile
彻底梳理onnxruntime代码(4):session.Run流程、执行compute_func、模型的re-compile
2026-01-05 11:33:03
1165
原创 彻底梳理onnxruntime代码(3):CreateSessionAndLoadModel、模型加载、InitializeSession、EP创建与注册、核函数注册、模型编译与优化
彻底梳理onnxruntime代码(3):CreateSessionAndLoadModel、模型加载、InitializeSession、EP创建与注册、核函数注册、模型编译与优化
2026-01-05 11:31:52
841
原创 彻底梳理onnxruntime代码(2): sessionOptions.AppendExecutionProvider、加载后端库、注册核函数
彻底梳理onnxruntime代码(2): sessionOptions.AppendExecutionProvider、加载后端库、注册核函数
2026-01-05 11:29:22
1023
原创 彻底梳理onnxruntime代码(1):ortApis代码流程、C与C++接口的关系、怎么获取OrtApiBase结构体
彻底梳理onnxruntime代码(1):ortApis代码流程、C与C++接口的关系、怎么获取OrtApiBase结构体
2026-01-05 11:28:04
966
原创 Transformer彻底剖析(5):带掩码的多头自注意力与多头编解码注意力、三个注意力模块有什么区别,作用分别是什么
Transformer彻底剖析(5):带掩码的多头自注意力与多头编解码注意力
2025-12-21 08:57:00
1052
原创 一个由代码规范性导致的bug:结构体没有memset导致的Segmentation fault (core dumped)
一个由代码规范性导致的bug:结构体没有memset导致的Segmentation fault (core dumped)
2025-12-17 14:34:44
319
瑞芯微RV1126开发板算法移植说明文档-环境搭建-opencv交叉编译-C++推理代码-yolov5算法移植-分类算法移植-人脸检测识别算法移植
2025-01-16
pytorch学习视频百度网盘链接.txt
2020-02-23
ndjpnladcallmjemlbaebfadecfhkepb.zip
2020-08-04
2020-07-24-21-20-52-download-P3X-OneNote-2020.10.105.AppImage
2020-08-04
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅
1