<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[我的笔记本]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/bandaoyu</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; bandaoyu]]></copyright><item><title><![CDATA[【CUDA】什么是DSL]]></title><link>https://blog.csdn.net/bandaoyu/article/details/163863371</link><guid>https://blog.csdn.net/bandaoyu/article/details/163863371</guid><author>bandaoyu</author><pubDate>Tue, 18 Aug 2026 20:49:27 +0800</pubDate><description><![CDATA[DSL就是“给某个领域设计的小语言”。它让用户描述“我要什么”，而不是“计算机一步一步怎么做”。TileLang是GPU Kernel领域的DSL；TileFusion更像提供了一套C++ Tile编程抽象库。]]></description><category></category></item><item><title><![CDATA[【CUDA】TileFusion]]></title><link>https://blog.csdn.net/bandaoyu/article/details/163804942</link><guid>https://blog.csdn.net/bandaoyu/article/details/163804942</guid><author>bandaoyu</author><pubDate>Mon, 17 Aug 2026 00:55:10 +0800</pubDate><description><![CDATA[TileFusionTileFusion 不是一个独立的 kernel 库，而是 FractalTensor 框架中的一个 tile-level GPU kernel 编程与生成后端（backend）的编程库，用于支持 FractalTensor 自动生成融合 GPU kernel。tile 分块抽象；tile 数据移动 API；tile 计算 API；tile fusion 机制；thread；block；warp；而是在 tile 层描述计算。ThreadWarp。]]></description><category></category></item><item><title><![CDATA[【翻译】在多GPU上利用动态In-Switch计算加速MoE]]></title><link>https://blog.csdn.net/bandaoyu/article/details/162674901</link><guid>https://blog.csdn.net/bandaoyu/article/details/162674901</guid><author>bandaoyu</author><pubDate>Tue, 07 Jul 2026 22:58:32 +0800</pubDate><description><![CDATA[混合专家模型（MoE）已被许多领先的大模型采用，以降低计算需求。然而，MoE专家并行（EP）中频繁的GPU间通信成为了性能挑战。我们观察到MoE中存在大量的冗余GPU间数据传输，这有望通过in-switch计算来解决。不幸的是，现有的解决方案NVLink SHARP（NVLS）仅能支持具有规则模式的静态集合通信，无法处理MoE中具有不规则模式的动态通信。]]></description><category></category></item><item><title><![CDATA[大模型训练并行技术理解-DP/TP/PP/SP/EP]]></title><link>https://blog.csdn.net/bandaoyu/article/details/162608515</link><guid>https://blog.csdn.net/bandaoyu/article/details/162608515</guid><author>bandaoyu</author><pubDate>Sun, 05 Jul 2026 18:16:32 +0800</pubDate><description><![CDATA[统一设定：GPU = 厨师，完整模型 = 全套做菜菜谱，训练样本 = 客人订单，张量 / 激活 = 半成品食材，梯度 = 口味修正意见，高速互联 xGMI/NVLink = 厨师间快速传菜通道。需要熬一锅巨型酱汁，一个人处理不完，4 位厨师同时协作制作这一锅酱汁，每人只负责一半配料。订单太多，把客人分成 4 批：厨师 1 做第 1 批客人，厨师 2 做第 2 批，各自独立从头做到尾。把做菜步骤拆开，每人只干固定一步： 厨师 1：只切肉 厨师 2：只炖肉 厨师 3：只调酱汁 厨师 4：只装盘。]]></description><category></category></item><item><title><![CDATA[【CUDA】cubin是什么]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161912367</link><guid>https://blog.csdn.net/bandaoyu/article/details/161912367</guid><author>bandaoyu</author><pubDate>Fri, 12 Jun 2026 05:07:26 +0800</pubDate><description><![CDATA[<<>>>：直接启动cubin：先加载模块，再它们是同一类 kernel 的两种装载/启动路径。]]></description><category></category></item><item><title><![CDATA[【CUDA】MNNVL和NVLS的关系]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161807927</link><guid>https://blog.csdn.net/bandaoyu/article/details/161807927</guid><author>bandaoyu</author><pubDate>Mon, 08 Jun 2026 21:09:11 +0800</pubDate><description><![CDATA[MNNVL = 多节点 NVLink 组网（路）NVLS = NVLink 网络上的硬件卸载（加速器）关系：NVLS 运行在 MNNVL 构建的 NVLink Fabric 之上，是 MNNVL 的增强特性。subgraph A [多节点NVLink集群]Node1[GPU节点1] --- NVSwitch_Fabric[NVSwitch Fabric<br>跨节点NVLink全连接] --- Node2[GPU节点2]endsubgraph B [NVLS加速层]]]></description><category></category></item><item><title><![CDATA[【AMD】HDP（Host Data Path）是什么]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161491296</link><guid>https://blog.csdn.net/bandaoyu/article/details/161491296</guid><author>bandaoyu</author><pubDate>Thu, 28 May 2026 18:07:38 +0800</pubDate><description><![CDATA[1. HDPHDP =，是 AMD GPU 内部的一个硬件单元，而不是夹在 HCA/CPU 和 GPU 中间的独立桥。它的职责是处理"host 或 PCIe peer 访问 GPU 显存(HBM)"这条路径。HDP 就在 GPU 芯片内部、PCIe 接口和显存之间，是 HCA/CPU 直访显存的专用 “门 / 桥”。提供 HCA/CPU<-> GPU 显存的直接访问通路，让 HCA/CPU 能通过PCI BAR地址空间，直接读 / 写 GPU 的 VRAM，不用走复杂 DMA 或驱动拷贝。]]></description><category></category></item><item><title><![CDATA[【超节点】HSA跨节点直接访存的原理]]></title><link>https://blog.csdn.net/bandaoyu/article/details/159252228</link><guid>https://blog.csdn.net/bandaoyu/article/details/159252228</guid><author>bandaoyu</author><pubDate>Tue, 26 May 2026 08:52:33 +0800</pubDate><description><![CDATA[前两个概念不难理解，简单来说就是路修宽点（大带宽），车跑快点（低时延），最核心、最难实现的恰恰是“内存统一编址”：目标是构建一个全局唯一的虚拟地址空间，集群内所有芯片的内存资源被映射成一张巨大的地图，不管数据是在自己的显存里，还是在隔壁机柜的内存里，对于计算单元来说，只是一个地址的区别。HySwitch驱动做的是同样的事，只是范围扩展到了跨节点。HySwitch做的是内存地址级别的路由，路由的地址是物理地址还，超节点上每个节点上的 GPU 卡的物理地址会不会与其他节点的物理地址冲突？]]></description><category></category></item><item><title><![CDATA[【RDMA】CST=Consistency at Target（目标端一致性操作）]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161322766</link><guid>https://blog.csdn.net/bandaoyu/article/details/161322766</guid><author>bandaoyu</author><pubDate>Fri, 22 May 2026 20:22:22 +0800</pubDate><description><![CDATA[说人话：CST 就是本地显卡往别的显卡内存里发数据、做修改，数据走网卡、线路传输，不会立马稳稳落到对方显存里，还可能先后顺序乱掉。CST 的作用：把前面所有发出去的写入、数据改动，全部从缓存规整送达目标显卡内存。做完这步收尾后，对方显卡再去读取数据、判断信号、等待任务时，拿到的一定是最新数据，不会读到因新数据滞留缓存未落地覆盖，残存在目标显存地址上的旧数据、残缺数据。划定操作边界，保障 CST 前后操作逻辑有序，规避传输延迟引发的数据异常。]]></description><category></category></item><item><title><![CDATA[【GDR】 GPU内存和VMM 的RDMA 内存注册|nvidia-peerme]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161262658</link><guid>https://blog.csdn.net/bandaoyu/article/details/161262658</guid><author>bandaoyu</author><pubDate>Wed, 20 May 2026 18:51:06 +0800</pubDate><description><![CDATA[是 NVIDIA 提供的 Linux 内核模块（），核心作用是，让 网卡无需经过主机内存，能直接对 GPU 显存做 RDMA 读写，是的关键组件。]]></description><category></category></item><item><title><![CDATA[【CUDA】store/load普通访存 vs 非临时（Non-Temporal）访存]]></title><link>https://blog.csdn.net/bandaoyu/article/details/161120665</link><guid>https://blog.csdn.net/bandaoyu/article/details/161120665</guid><author>bandaoyu</author><pubDate>Fri, 15 May 2026 19:51:35 +0800</pubDate><description><![CDATA[普通 flag 循环：走 cache、强一致、延迟高，适合通用通信。非临时访存：绕 cache、无一致、低延迟高吞吐，专为 VMM 跨卡 ping-pong 极限性能测试设计。Core├───默认路径：Core → L1 → L2 → L3 → 主存（带缓存、带一致性）└───非临时路径：Core → 内存控制器 → 主存（绕开L1/L2，不驻留）]]></description><category></category></item><item><title><![CDATA[【NCCL】NCCL Inspector + Prometheus对NCCL实时监控与快速调试]]></title><link>https://blog.csdn.net/bandaoyu/article/details/160896573</link><guid>https://blog.csdn.net/bandaoyu/article/details/160896573</guid><author>bandaoyu</author><pubDate>Fri, 08 May 2026 18:01:19 +0800</pubDate><description><![CDATA[介绍了 NCCL Inspector 离线模式。尽管细粒度分析仍是深入分析数据的标准方式，但本文介绍了一项新功能——实时监控。现在，通过将 NCCL Inspector 与 Prometheus Exporter 集成，用户可以直接在其基础设施仪表板中生成实时的时间序列可视化图表。]]></description><category></category></item><item><title><![CDATA[【GPUDirect 】GPUDirect RDMA (GDR)、GPUDirect Async (GDA)技术是什么？GPUDirect 家族]]></title><link>https://blog.csdn.net/bandaoyu/article/details/160316834</link><guid>https://blog.csdn.net/bandaoyu/article/details/160316834</guid><author>bandaoyu</author><pubDate>Mon, 20 Apr 2026 00:19:17 +0800</pubDate><description><![CDATA[存储→GPU数据路径减少CPU拷贝开销，I/O延迟降低40%+HPC、AI大规模数据加载。]]></description><category></category></item><item><title><![CDATA[【CUDA】NVbandwidth：测量 GPU 互连和内存性能的必备工具]]></title><link>https://blog.csdn.net/bandaoyu/article/details/160316610</link><guid>https://blog.csdn.net/bandaoyu/article/details/160316610</guid><author>bandaoyu</author><pubDate>Sun, 19 Apr 2026 23:55:18 +0800</pubDate><description><![CDATA[NVbandwidth 是一款基于 CUDA 的工具，它可通过复制引擎（CE）或内核复制两种方式（copy engine (CE) or kernel copy methods.），测量不同链路下各类内存复制模式的带宽与延迟。该工具会报告你当前系统的实测带宽，让你深入了解 GPU 配置的性能特征。尽管现代 GPU 具备出色的计算能力，但其性能往往受限于不同设备间的数据传输速度。CPU 内存到 GPU 内存GPU 内存到 CPU 内存GPU 内存到 GPU 内存评估系统性能测量内存访问延迟。]]></description><category></category></item><item><title><![CDATA[【NVSHMEM】PCIe 距离类型(PIX,PXB,PHB,NOD,SYS)和判断]]></title><link>https://blog.csdn.net/bandaoyu/article/details/158935043</link><guid>https://blog.csdn.net/bandaoyu/article/details/158935043</guid><author>bandaoyu</author><pubDate>Wed, 11 Mar 2026 22:09:59 +0800</pubDate><description><![CDATA[PATH_PIX(0): 相同设备，最优PATH_PXB(1): 通过 PCIe 交换机连接PATH_PHB(2): 通过 Host 桥接PATH_NODE(3): 同一 NUMA 节点PATH_SYS(4): 跨系统，最差通过比较 PCIe 路径字符串的公共前缀长度判断距离。]]></description><category></category></item><item><title><![CDATA[【nvshmem】nvshmem中的DMA buf是什么？]]></title><link>https://blog.csdn.net/bandaoyu/article/details/158509124</link><guid>https://blog.csdn.net/bandaoyu/article/details/158509124</guid><author>bandaoyu</author><pubDate>Sat, 28 Feb 2026 18:46:06 +0800</pubDate><description><![CDATA[dma-buf 目的:解决各个驱动之间 buffer 零拷贝共享的问题。dma-buf是 fd + buffer 的结合体，fd 用于标识和管理 buffer,同时 控制访问权限,buffer 是实际的内存区域。buf由设备驱动预先分配并导出，与一个 FD 结对，形成一个 DMA BUF。使用者可以通过 FD 符将 buf 映射到自己的地址空间，从而实现buf的访问。（说明，1: 这个 buffer可能属于不同设备（如 GPU 显存、网卡 DMA 区域），而不仅是 CPU 内存。]]></description><category></category></item><item><title><![CDATA[【工具】docx/word转MD:Pandoc]]></title><link>https://blog.csdn.net/bandaoyu/article/details/158468638</link><guid>https://blog.csdn.net/bandaoyu/article/details/158468638</guid><author>bandaoyu</author><pubDate>Fri, 27 Feb 2026 18:12:54 +0800</pubDate><description><![CDATA[将文件从一种标记格式转换为另一种格式（比如 html 和 markdown等标记语言），它可以将文档在 Markdown、LaTeX、reStructuredText、HTML、Word docx 等多种标记格式之间相互转换，并支持输出 PDF、EPUB、HTML 幻灯片等多种格式。先指定输入/输出格式-f-t）→指定输出文件-o）→补充样式/结构参数-s--toc-f-t-o-s--toc，其余参数按需使用；复杂需求（如自定义样式、批量配置）可通过--defaults实现，减少重复输入参数。]]></description><category></category></item><item><title><![CDATA[【NCCL】NCCL通信协议:Simple, LL, LL128]]></title><link>https://blog.csdn.net/bandaoyu/article/details/158427203</link><guid>https://blog.csdn.net/bandaoyu/article/details/158427203</guid><author>bandaoyu</author><pubDate>Thu, 26 Feb 2026 18:01:58 +0800</pubDate><description><![CDATA[摘要：NCCL提供了Simple、LL和LL128三种通信协议，针对不同数据规模优化传输效率。Simple协议采用连续缓冲区设计，有效载荷接近100%，适合大消息传输；LL协议通过内嵌flag实现低延迟，但有效载荷仅50%，适合小消息；LL128协议在两者间取得平衡，有效载荷达93.75%，适合中等消息。协议选择由NCCL自动完成，考虑硬件拓扑和消息大小，也可通过环境变量强制指定。不同协议在缓冲区布局和同步机制上存在差异，分别优化吞吐量、延迟或两者平衡。]]></description><category></category></item><item><title><![CDATA[【RCCL】RCCL工具]]></title><link>https://blog.csdn.net/bandaoyu/article/details/158392204</link><guid>https://blog.csdn.net/bandaoyu/article/details/158392204</guid><author>bandaoyu</author><pubDate>Wed, 25 Feb 2026 20:34:43 +0800</pubDate><description><![CDATA[普通监控工具只能告诉你“这辆车跑完一圈用了多少秒”。NPKit则能告诉你“在第三个弯道的入弯阶段，左后轮胎的抓地力在第 3.5 秒到 3.8 秒之间出现了微小的波动，导致速度下降了 0.2%”。]]></description><category></category></item><item><title><![CDATA[【RDMA】rdma指令]]></title><link>https://blog.csdn.net/bandaoyu/article/details/157478974</link><guid>https://blog.csdn.net/bandaoyu/article/details/157478974</guid><author>bandaoyu</author><pubDate>Wed, 28 Jan 2026 21:48:35 +0800</pubDate><description><![CDATA[工具包的一部分，主要用于管理 RDMA（Remote Direct Memory Access）设备。man rdma # 查看完整手册。# 显示 CM（连接管理器）ID。# 显示 CQ（完成队列）# 显示 MR（内存区域）# 显示 PD（保护域）# 显示 QP（队列对）# 尝试不同的输出格式。# 显示特定设备的资源。# 尝试其他资源类型。]]></description><category></category></item></channel></rss>