- 博客(1585)
- 资源 (68)
- 收藏
- 关注
原创 C/C++学习总结
文章目录Markdown常用语法一、面试二、编程语言1.C/C++(1)C和C++进阶的学习笔记总结目录(2)Linux系统编程(3)C语言开源项目(4)C++开源项目(5)Linux运维2.java3.python4.数据结构与算法三、分布式四、Docker,OpenStack五、Github和开源项目学习六、个人简历七、关于测试八、镜像地址或网站九、自勉之语Markdown常用语法 (1)CSDN Markdown空行:  (2)分割线:用三个以上的星号、减号、底线来建立一个分
2020-08-16 20:14:00
2863
1
原创 Triton算子入门之Tensor-Puzzles
每个小格表示 Tensor 的一个元素:图中第一个白色格子通常表示起始位置(索引 0),后面的黄色格子表示后续元素,用来直观展示 Tensor 的长度和元素排列。eg:PyTorch 的 Broadcasting(广播机制)
2026-07-30 12:31:25
38
原创 TRITON BENCH:面向 Triton 算子生成的 LLM 基准测试
TRITON BENCH 把 LLM 代码生成评测推进到了更贴近系统工程的位置:不仅问“模型能不能写对代码”,还问“模型写出的代码能不能在 GPU 上跑得快”。从结果看,当前模型距离稳定生成高质量 Triton 算子还有明显差距。真实 GitHub 算子集上,最强模型的 Execution Accuracy 也只有约 24%;PyTorch 对齐任务更容易,但仍远未达到可靠自动化开发的水平。这篇论文的价值不在于证明某个模型更强,而在于给高性能代码生成建立了一个更合理的评估框架。
2026-07-29 16:27:22
244
原创 Triton算子入门之gpu-puzzles
实现一个“核”函数,该函数对向量 a 中的每个元素加 10,并将结果存储在向量 out 中。每个位置对应一个线程的处理时间。提示:可以将函数 call 视为每个线程仅运行一次。唯一的区别在于 cuda.threadIdx.x 会在每次运行时发生变化。项目需要python notebook需要google Colab环境运行,本学习仅学习CUDA相关知识。
2026-07-22 14:52:35
236
原创 LLVM后端实操编译Cpu0, Build Cpu0
跑通 Cpu0 后端是 LLVM 后端开发的第一关。理解 LLVM 后端编译的整体流程动手修改 TableGen 描述文件用验证 Target 注册读Chapter3_1的代码,看add/sub指令是怎么加的尝试自己加一条新指令(比如mul用看指令选择过程LLVM 后端不是靠"看"学会的,是靠"调"出来的。疯狂编译、疯狂报错、疯狂改代码,这是唯一的路。
2026-07-13 14:26:32
220
原创 TritonIR剖析:从 Python Kernel 到 GPU 指令,TTIR/TTGIR 全流程拆解
Pass干啥为什么重要规范化 IR,常量折叠 + 代数化简让后续 Pass 更容易命中模式CSE消除重复计算省寄存器、省 ALU,提升 occupancyInliner展开所有函数调用GPU 不支持 call,必须内联拆解张量指针为底层地址计算连接高层语义与 LLVM IR 的关键桥梁。
2026-07-11 09:22:11
359
原创 Triton编译流程:调了一个通宵后,我终于搞懂了 Triton 的编译流程
IR 层次抽象级别关心的东西典型操作Triton IR算法级硬件映射级调度映射、bank conflict 优化LLVM IR指令级寄存器 / 内存 / 同步展开为 SSA、生成 PTX从 TTIR → TTGIR → LLVM IR 的 lowering 过程,本质上是一个「逐步丧失抽象、逐步获取性能」的过程。每一层丢掉一些通用性,换来更贴近硬件的执行效率。这也是 MLIR 的核心设计哲学——不是为了多套几层 IR 炫技,而是每一步 lowering 都有明确的优化机会。
2026-07-04 11:05:39
319
原创 Triton调试:Triton调试从入门到裂开再到起飞:一套工具链吃透MLIR全流程
的职责是把MLIR转换成最终的可执行产物——PTX或LLVM IR。它在pipeline中处于最末端。# ttgir → llir triton-translate XX.ttgir --target = llvmir &> XX.llir # ttgir → ptx(如果需要直接看PTX汇编) triton-translate XX.ttgir --mlir-to-ptx -o XX.ptx和triton-opttriton-opt:管IR的变换(优化Pass):管IR到目标代码的翻译。
2026-07-04 10:54:57
468
原创 Trition程序编写:从“Hello CUDA“到“Hello Triton“:向量加法背后的编译黑魔法
—GPU 上不会直接 crash,但算出来的结果可能完全对,也可能偶尔错,特别难排查。
2026-07-04 10:41:40
455
原创 Triton源码目录:打开Triton源码的正确姿势:从一头雾水到心里有数
Triton的源码结构本质上就是一条MLIR编译管线include/ (定义) → lib/Dialect/ (IR实现) → lib/Conversion/ (Dialect降级) → lib/Target/ (代码生成)先看,搞清楚Triton有哪些基础操作跟踪triton.dot从 Triton Dialect → TritonGPU → LLVM 的完整降级路径用实际跑一遍 Pass Pipeline,直观感受每个Pass的效果。
2026-07-04 10:22:30
359
原创 Triton安装方式:Triton 安装方式完全指南:从 pip 一键安装到 LLVM 源码编译
Triton 安装的核心矛盾在于LLVM 编译。:快速验证、学习用,对环境要求高但省心源码编译:生产环境、定制需求,灵活但耗时且容易踩坑真想省事的话,直接用 Docker 镜像或者 Autodl 等云平台上的预配环境——但早晚有一天你得自己编译一遍,那时候这篇就能帮你少踩 80% 的坑。
2026-07-03 17:44:27
448
原创 Triton概述:你写的CUDA Kernel跑了三天才优化完,而Triton只用了30行Python
三年前第一次用CUDA写矩阵乘,对着__shared__调了一整个通宵,运行时间从 12ms 降到 8ms。隔壁实习生用 Triton 花了 30 分钟写出 30 行 Python,跑出来 7ms。那一刻想摔键盘。这是很多人接触 Triton 时的真实心路历程。它不是另一个深度学习框架——而是一把专门针对 GPU Kernel 开发的"自动挡"螺丝刀。
2026-07-03 17:33:26
353
原创 PyTorch三方组件快速适配深度解读
现象:编译报,比如float2和float的乘法运算符在两个头文件里都有定义。修法// 只在非 HIP 环境下生效的自定义实现#endif版本对齐是第一要务:DTK、PyTorch、FastPT 三个版本必须对得上,去 DAS 社区的 FastPT 仓查版本对应表。-C和-E各司其职-C管编译,-E管运行。编译好的 whl 包在新环境部署时只需-E,别手贱再跑一次-C。第一个 error 是关键:编译报错一堆时,优先解决第一个 error。后续的错往往是第一个引起的连锁反应。
2026-06-25 15:06:03
354
原创 PyTorch框架使用基础深度解读
安装:走DAS源,注意DTK版本匹配,别用官方PyTorch环境验证别忘,确认:一行代码换性能,但第一次编译要有耐心分布式:GPU训练无脑选RCCL,多节点注意网卡名和IB配置调优:NUMA绑定 + DataLoader参数 + profiler定位瓶颈,三步走声明:本文基于公开技术资料与个人实践整理,所有具体版本号、内部节点名、性能数据均已做脱敏处理。文中mermaid图均为原创绘制。(内容由AI生成,仅供参考)
2026-06-25 15:05:00
252
原创 NVIDIA Blackwell架构深度解读
维度趋势Blackwell体现芯片设计单Die→Chiplet多Die合封B200双Die通过NV-HBI互联精度路线推理精度向FP4下探首次支持FP6/FP4显存HBM容量、带宽持续增长互联L1域规模从8卡跃升到72卡机架从单机到整机柜一体化交付NVL72是完整产品网络Scale-Out网卡进入800G时代当模型参数规模持续膨胀(十万亿级)、上下文长度进入百万Token级,单卡算力增长已经跟不上需求了。未来的竞争焦点,会从"单卡有多强"转变为"一个机架能提供多少有效算力和显存带宽"。
2026-06-25 15:04:13
604
原创 DTK异构数学库与AI算子开发深度解读
层次优化手段核心思路算法层向量外积、分块策略提升计算访存比,减少冗余内存访问访存层数据预取、LDS 重构、双缓冲、PAD 填充隐藏访存延迟、消除 Bank 冲突、减少同步等待硬件层TensorCore 指令、BlockSwizzle充分利用专用计算单元、提升 Cache 命中率工程层算子生成器 DOT自动化搜索最优 Kernel 配置,告别手写调参别让计算单元闲着。有了数据就赶紧算,算完了下一批数据已经在路上了。GPU/加速卡编程的本质就是——管理好从显存到计算单元这条"数据流水线"。
2026-06-25 15:03:05
356
原创 DTK异构调试调优工具深度解读
DCU平台的调试调优工具链已经比较完整了,覆盖从环境搭建→调试定位→性能调优→集群部署的全流程。核心要点回顾调试首选hipgdb(功能强)和(轻量快)性能分析首选hipprof,tracing找瓶颈、PMC找原因环境有问题先用du-diag排除硬件故障调优遵循APOD方法论:评估 → 分析 → 优化 → 验证工具只是手段,真正的能力是建立对DCU硬件行为的直觉——多跑几次PMC,多看看Perfetto时间线,慢慢就有感觉了。参考资源。
2026-06-25 15:00:23
462
原创 DCU编译自动调优深度解读
fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;1. 环境准备装依赖 + 设环境变量2. 启动调优3. 自动搜索AUC Bandit 多策略并行4. 收敛完成输出 final_config.yaml5. 影响性分析6. 精简配置7. 后续编译直接引用。
2026-06-25 14:57:19
469
原创 DCU大模型训练优化深度解读
类别方案核心思路通信优化flux TP融合、A2A Overlap、量化通信、EDGC、SDP4bit让通信和计算重叠/压缩通信量显存优化参数副本复用、激活值卸载、Block-wise INT8省显存、降低精度成本调度优化消灭流水线气泡MoE专项专家负载均衡、低延迟通信大模型训练优化没有银弹。不同模型结构、不同规模、不同网络拓扑,最优方案都不一样。最好的策略是把这些方案都集成进训练框架,根据实际任务按需组合。如果你也在折腾大模型训练,欢迎交流踩坑经验。
2026-06-25 14:55:42
348
原创 DCU BW集群组网深度解读
HYSwitch 方案在链路数、点对点带宽、集合通信能力三个维度上全面碾压 PCIe Switch 方案。做大规模并行训练,这个差距是决定性的。
2026-06-24 10:54:47
153
原创 DCU BW产品特性深度解读
互联拓扑架构领先:自研交换芯片 + Clos 全互联,P2P 带宽 448GB/s,对分带宽 1792GB/s,对比 Fullmesh 方案有 2-8 倍的差距。大模型 TP 并行和多机 Scale-Out 场景优势明显。软件生态兼容性好:HIP 编程模型 + DTK 数学库做到了 CUDA 兼容,PyTorch/vLLM 等主流框架覆盖度 98%+,迁移成本低。全场景覆盖:从 AI 训练推理到科学计算(分子动力学、计算化学、气象环境),从单卡到万卡集群,一套方案打全场。
2026-06-24 10:53:40
407
原创 超节点产品市场分析深度解读
当模型大到单机装不下、集群大到通信跟不上的时候,算力基础设施该怎么进化?目前行业给出的答案是"高带宽域+统一编址+软硬协同",从NVIDIA的GB200到HW的CloudMatrix再到国内各家方案,大家都在往这个方向走。产品成熟度和生态完善性还有差距,但方向很明确。这个市场变化很快,以上信息截止到2025年底,仅供参考交流。如果你在做大模型训推基础设施的选型,建议还是直接去各家官网拉最新规格书——毕竟这个赛道的迭代是以季度为单位的。本文内容基于公开市场信息整理,不包含任何企业内部数据或分析视角。
2026-06-24 10:52:09
313
原创 基于DCU的AI编译生态深度解读
层级优化方向具体手段适用场景编译器层指令优化矩阵指令支持、指令重排、流水线规划所有模型编译器层PASS开发FlashAttention定制、多级流水、Swizzle大模型推理/训练编译器层图算优化Inductor优化、子图亲和性、选优策略模型训练框架层max-autotune模式、环境变量调优PyTorch模型框架层优化器Fused模式、通算同流训练场景应用层混合精度推理为主应用层同步消除non_blocking搬运、矩阵批量计算所有场景应用层。
2026-06-24 10:51:19
135
原创 LightOP高阶算子库深度解读
能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成INT8适合什么场景?正在部署DeepSeek/Qwen/LLaMA系列大模型。
2026-06-24 10:49:51
370
原创 基于DCU的大模型推理优化深度解读
框架层:选对基座(vLLM)、做好适配(layout/调度/算子),让模型先"跑起来且跑得顺"算子层:瞄准热点(MLA/Attention/MoE),逐算子压榨,MLA优化是DeepSeek系模型的重中之重量化层:混合精度是王道——MoE用低比特(W4A8)、Attention保精度(W8A8),KVCache用FP8工具链:AutoTuning解决"每个模型每个硬件都要调"的工程化问题一句话概括:大模型推理优化没有银弹,是框架适配 + 算子精调 + 量化压缩 + 自动化工具的四层体系持续迭代。
2026-06-24 10:49:01
422
原创 国产AI加速器竞品调研深度解读
大模型时代,卡间互联能力跟单卡算力同等重要。ScaleUp不是可选项,是必选项。双芯合封 ≠ Chiplet。一个是拼凑,一个是融合。性能收益、调度复杂度、可用性都有本质区别。买卡之前先搞清楚封装形态。GPGPU vs DSA,路线之争已经明朗。LM时代DSA的专用设计增益消失,封闭生态的代价却越来越大。转向GPGPU是大概率事件——对客户来说,选择生态成熟、持续演进的路线很重要。Switch芯片是分水岭。没有Switch就做不好SuperPod,而SuperPod是未来几年AI基建的主战场。
2026-06-24 10:47:47
336
原创 大模型Attention算子实现与优化深度解读
Softmax → Online Softmax → Flash Attention → Chain GEMM → 四级Buffer →Causal均衡 → 反向优化 → FlashMLA → 量化(FP8) + 稀疏化(BLASST/Sparge/SLA)Online Softmax是分块计算的理论基础,没有增量更新就没有后续的一切。Chain GEMM的落地关键是Gemm0多次mmac融合,省掉了线程间数据交换,换来18%的性能提升。四级Buffer是多级流水的典范。
2026-06-24 10:46:52
503
原创 大模型分布式训练容错技术深度解读
分布式训练容错不是什么花活,是千卡以上规模训练必须过的坎。训前排雷:NHC + Rccl + GEMM 三重检测,别让坏节点混进训练池。训中兜底:hyckpt 异步 Checkpoint + 跨节点内存协同备份,故障恢复从分钟级压到秒级。自动闭环:状态机自动检测→隔离→替换→重启,全程不需要人盯着。目前这套方案在国产加速卡集群上已经跑过 64 节点 llama3_70b 的实测验证。后续方向包括适配更多训练框架(不仅限于 Megatron),以及补充计算错误检测等能力。参考。
2026-06-24 10:44:49
248
原创 常见GPU通信库深度解读
场景用哪个原因大模型数据并行训练的梯度同步规则、大块、全员参与MoE的专家路由分发选择性分发、细粒度模型并行中的张量切分通信规则集合通信稀疏图神经网络的邻居聚合不规则、动态目标分布式数据加载的Broadcast一对多规则分发规则的大块传输交给RCCL,不规则的细粒度One-Sided访问交给NVSHMEM。两个库不是"你死我活"的关系,而是各管一摊、互相配合。千卡集群上跑大模型训练,两个都得搞明白。本文基于内部技术培训材料整理,已对敏感信息做脱敏处理。
2026-06-24 10:40:49
368
原创 大模型推理加速200%+?这套国产融合算子库把CUDA/Triton全替换了
能融合的都融合了:Reduce类算子3合1、大模型算子9合1——减少的是kernel launch开销和中间结果的显存读写,这些都是"看不见的耗时"该分开的都分开了:Prefill和Decoding走不同的实现路径,访存密集型和计算密集型各用各的优化策略——没有"一刀切"量化不只是精度换速度:SmoothQuant、W4A8重排压缩、多级流水掩盖——这是一套完整的量化部署方案,不只是把FP16换成INT8适合什么场景?正在部署DeepSeek/Qwen/LLaMA系列大模型。
2026-06-23 14:58:12
430
原创 在DCU上把PyTorch跑起来,我踩过的5个坑和一份踩坑指南
安装:走DAS源,注意DTK版本匹配,别用官方PyTorch环境验证别忘,确认:一行代码换性能,但第一次编译要有耐心分布式:GPU训练无脑选RCCL,多节点注意网卡名和IB配置调优:NUMA绑定 + DataLoader参数 + profiler定位瓶颈,三步走。
2026-06-23 14:56:26
469
原创 从CUDA迁移到DTK:一个后端开发踩过的坑和真相
Warp Size从32变64——线程块大小、共享内存bank冲突策略全部要重新评估动态并行不支持——kernel嵌套调用的逻辑需要展平,别硬搬__syncwarp不支持——线程束级细粒度同步得重新设计异步操作不支持——异步拷贝等场景用同步替代,IO模式需要调整Pinned Memory一定要用——Host↔Device带宽差距巨大,这步不做纯属浪费硬件迁移不是简单的API替换。把硬件差异吃透了,才能在DCU上写出真正跑得快的代码。
2026-06-23 14:53:59
323
原创 花几十万买加速卡,利用率不到50%?拆解海光DAS如何把国产DCU性能榨干
回到最实际的问题:如果你的团队在考虑国产化AI平台迁移,DAS值不值得投入?300+模型适配验证,拿来就能用,适配周期大幅缩短万卡集群验证通过,不只是小规模Demo,能上生产系统工程优化扎实,不是"能跑就行"的水平容器镜像 + FastPT工具链,工程化程度不错OpenDAS开源 + 版本快速迭代,生态在加速生长算子覆盖率跟CUDA生态还有数量级差距,LightOP 50+ vs CUDA数万PyTorch版本追得气喘吁吁,社区一个版本出来,DAS适配要滞后一段时间。
2026-06-23 11:08:02
451
原创 LLVM SelectionDAG 入门:从 IR 到机器指令到底发生了什么?
把每个 basic block 的 LLVM IR 建成 DAG把目标不支持的类型变合法把目标不支持的操作变合法用 DAGCombiner 清理和做目标相关 peephole把通用 DAG 节点选择成机器节点调度成线性机器指令序列它最难的地方不在某个单独 API,而在于“通用逻辑”和“目标相关逻辑”之间的边界。这是类型不合法,还是操作不合法?这是通用 lowering 能解决,还是必须目标自定义?
2026-06-08 13:52:39
473
原创 LLVM 后端流程与关键数据结构:从 IR 到机器码的入门笔记
写一个 C 程序,最后能跑起来,中间不是只有一个“编译器”在工作,而是一整套工具在接力。工具作用编译器前端读取 C/C++/Objective-C 等源代码,做词法、语法、语义分析,生成中间表示编译器后端把中间表示翻译成目标机器能理解的汇编或机器码汇编器把.s汇编文本转成.o目标文件链接器把多个.o和库链接成可执行文件或动态库反汇编器把机器码还原成汇编文本,便于分析调试器运行、断点、查看寄存器和内存这就是 toolchain,也就是“工具链”。
2026-06-05 15:50:16
476
原创 claude-code-large-codebase-harness-csdn
CLAUDE.md是基础,不是垃圾桶,只放每次会话都需要的上下文;子目录可以维护自己的CLAUDE.md,让上下文随路径自动叠加;负责业务模块导航,解决“问题该去哪一层找”的问题;Hooks 做自动化,不负责提示词指挥;Skills 做按需专业知识加载,避免污染主上下文;LSP 让搜索从文本关键字升级到符号级导航;MCP、Plugins、Subagents 很有用,但应该建立在基础harness之上;所有配置都需要生命周期管理,过期规则要及时清理。在根目录写一份精炼的。
2026-05-20 15:55:34
491
原创 claude code 基础分享
团队共享,版本控制— 个人通用,跨项目**优先级:**项目级 > 用户级,同名 skill 项目级覆盖用户级------03 OMC 插件介绍。
2026-05-09 16:57:52
445
原创 C++ 基础教程:从入门到精通
/ 函数声明// 函数定义// 函数调用private:public:// 构造函数// 成员函数// 使用类。
2026-05-07 10:16:28
6734
vscode的remote ssh中需要的ubuntu服务器中的sshd配置文件
2022-06-19
postgresql数据库插件PG-Strom中Scan算子执行流程分析
2022-03-16
CUDAppt.zip
2021-12-28
跟我一起学C++.zip
2020-05-06
Shell编程ppt[C++教程网cppcourse[1].com].zip
2020-05-06
NetworkProgramming-master.zip
2020-05-06
Docker学习资料总结.7z
2020-02-08
muduo_server_learn.zip
2020-03-12
C++编程基础语法与高级特性综合教程:涵盖开发环境配置、核心数据类型及现代C++并发编程实践
2026-05-07
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅