- 博客(1261)
- 资源 (28)
- 收藏
- 关注
原创 nvCOMP 从开源到闭源的分水岭 2.2.0与基本原理概述
nvCOMP的API设计围绕易用性算法可交换性和极致性能这三个核心目标展开。其精髓在于分层设计:为普通用户提供简化的高级接口,为追求极致性能的专家提供底层的设备端扩展(nvCOMPDx)。
2026-08-11 18:29:45
26
原创 全文 - NVIDIA CuLitho and the Future of Inverse Lithography 与 cuLitho 简介
光学邻近校正(OPC, Optical Proximity Correction):修正光刻过程中因光的衍射和邻近效应导致的图案失真,确保掩模上的电路图案能准确投影到硅片上。逆光刻技术(ILT, Inverse Lithography Technology):通过逆成像算法求解最优掩模形状,以在先进制程下获得更高精度。掩模合成与全芯片修正(Mask Synthesis):包括全芯片邻近效应修正、模型构建与验证等。曲线流与曼哈顿流(Curvilinear & Manhattan Flows)
2026-08-11 14:56:12
42
原创 NVIDIA Agent Toolkits 简介与项目源码信息汇总
以下从开源内容/开源程度和第三方硬件算力公司接入方式两个维度,对 NVIDIA Agent Toolkit 进行系统性说明。维度实际情况开源程度代码完全开源(Apache 2.0),模型权重开放(OML),社区活跃;但生产级 NIM 和硬件加速库有商业/硬件绑定。第三方硬件接入可行性高。通过架构,任何支持 OpenAI-compatible API 的推理后端均可接入。接入最佳实践AMD/Intel/昇腾/Apple Silicon 均已有验证路径;
2026-08-11 13:51:39
86
原创 全文 - PhysicsNeMo README.md
NVIDIA PhysicsNeMo 是一个开源深度学习框架,用于构建、训练、微调和推理物理 AI 模型,采用面向 AI4Science(AI 驱动的科学研究)与工程领域的最先进 SciML 方法。PhysicsNeMo 提供 Python 模块,用于组合可扩展且经过优化的训练与推理流水线,帮助您探索、开发、验证并部署将物理知识与数据相结合的 AI 模型,实现实时预测。
2026-08-11 13:01:01
46
原创 全文 - UALink_200G Rev 1.0 Specification 第 2 章 UPLI 接口定义与操作规则
UPLI 接口定义了三类厂商自定义命令(VDC):读类 VDC(ReqCMD=0x08h-0x0Fh)、写类 VDC(ReqCMD=0x2Ch-0x2Fh)和原子类 VDC(ReqCMD=0x3Ch-0x3Fh)。对于每个厂商自定义命令,以下 UPLI 请求接口信号应由厂商定义:ReqASI、ReqAddr、ReqLen、ReqAttr 和 ReqMetaData。UPLI 请求接口中的其余信号应保持与非 VDC 相同的功能。
2026-08-10 16:40:23
321
原创 gem5 garnet 的演进,原理,实验
在下创建新的拓扑文件,继承Topology类,定义init()方法连接 routers、NI 和 links。修改// 在 outportComputeCustom() 中实现自定义逻辑// 例如:基于下游 VC 空闲状态的自适应路由// ... 自定义算法 ...然后使用调用。
2026-08-10 15:15:05
440
原创 全文 - UALink_200G Rev 1.0 Specification 第 1 章 引言
译自《UALink_200 Rev 1.0 Specification》(Ultra Accelerator Link Consortium Inc., 2025)第 1 章。
2026-08-09 18:51:23
272
原创 DOCA 文档
DOCA 框架提供了一套完整的软件套件,包含驱动程序、库、工具以及底层软件,用于与硬件设备及 BlueField 随附的默认操作系统进行交互。DOCA-Host和。组成部分说明DOCA SDK使开发者能够在 NVIDIA® BlueField® 网络平台上快速构建应用程序和服务,充分发挥业界标准 API 以及 NVIDIA BlueField DPU 和 SuperNIC 的强大能力。DOCA SDK 文档见此处。BlueField 平台软件。
2026-08-09 17:08:41
307
原创 从 vega 64 到 MI 100 ,AMD GPU 的裂变历史
核” = Compute Unit (CU),AMD GPU 的基本计算块。Vega 64= 64 CU,GCN 架构最后的游戏旗舰。MI 系列转向CDNA 纯计算架构,MI100 120 CU、MI200 128 CU/Die(MCM 双 Die),CU 数量与内部结构都发生了质变。MI100 的"大 bug"主要指电源管理失效和平台初始化兼容性差,加上早期 ROCm 软件生态不成熟,导致这款"首发 CDNA"产品在数据中心部署时踩坑颇多。
2026-08-09 15:38:05
302
原创 CUDA Graph 的原理与实现
当 kernel 本身只有几微秒时(如小 batch 推理、HPC 中细粒度通信、GXF/Holoscan 这类高频 pipeline),CPU 完全跟不上 GPU 的胃口——GPU 大量时间在"等 CPU 做饭"。它不改变任何 kernel 的语义,改变的是"谁在什么时候做调度决策"——从"CPU 每步做决策"变成"CPU 一次性决策、GPU 自主重放",代价是参数与拓扑的固化,换来的是数量级的调度开销削减和拓扑感知的自动并行。、kernel launch,把命令压入队列,GPU 顺序消费。
2026-08-08 21:51:30
147
原创 全文 - 图执行框架(Graph eXecution Framework, GXF)
GXF是 NVIDIA 推出的一个框架,提供基于组件的架构,专为开发硬件加速的计算图(compute graphs)而设计。该框架是其他高性能 SDK 的基础,例如DeepStream和Isaac ROS。例如,NITROS(NVIDIA Isaac Transport for ROS)利用嵌入在 ROS 2 节点中的 GXF 计算图,并通过优化的节点间传输机制,实现高效的 ROS 应用图。包位于 Isaac ROS NITROS 仓库中,该仓库持有 GXF 框架的二进制文件和头文件。本GXF。
2026-08-08 21:31:46
224
原创 git clone --mirror 完整迁移仓库的全流程
是迁移 Git 仓库最彻底、最可靠的方式,它会完整复制原仓库的所有引用(分支、标签、PR/MR 引用、notes 等),保证目标仓库与原仓库在 Git 对象层面完全一致。
2026-08-08 21:13:57
427
原创 ubuntu 22.04 -cuda12.8.2- holoscan-sdk-4.5-doca-ofed
1. 准备依赖# 2. 进入目录并安装(推荐 --all,跳过自带 UCX 避免后续冲突)# 3. 重启使内核模块生效# 4. 验证ibstat如果你只需要最基础的 RDMA 功能(不需要 OpenMPI、SHARP 等),可以改用。你的需求对应版本已装 OFED 24.10(同源驱动)需要 GPUNetIO(含(DOCA 3.x 要求 CUDA 13)V100 GPU(DOCA 3.x 的 GPUNetIO 针对 Ampere+ 优化,V100 本就受限)
2026-08-08 19:40:47
311
原创 高速串行链路的线路编码演进 和 Flit 级的纠错技术 -- pcie 6.4 的 1b/1b
PAM4 Gray+预编码让错误"单比特化" → 轻量交织 FEC 吃掉 99.9999% 的单符号错误(<2 ns)→ CRC-64 抓住漏网之鱼 → Replay 重传兜底。1b/1b 不是"放弃编码",而是把编码预算从"每比特征税"(8b/10b 的 25%)改为"每帧征税"(256 B 里 14 B ≈ 5.5%,且买到的是纠错而不仅是直流平衡)。
2026-08-07 15:19:03
352
原创 cx6 dx 网卡固件更新记录(mlxup不可用时)
mlxup版本有问题,用了 mlxfwmanager 进行更新。mlxup 内部也是调用 mlxfwmanager。mlxup 无法正确识别 版本,因为4.36 >2.0,它却认为小于。
2026-08-06 20:20:15
219
原创 Mellanox 网卡 更新固件的步骤
你的场景推荐方式命令单台服务器,已装 MFT,标准卡临时使用,不想装 MFT集群批量部署,开机自检修改启用升级 OFED/DOCA 顺便升固件(默认带固件更新)OEM 卡 / 需要指定版本 / 救砖mstflint如果你告诉我你的卡是标准 NVIDIA 卡还是OEM 定制卡(PSID 是否以MT_开头),以及当前 MFT/OFED 是否已安装,我可以给出最精简的一条命令。
2026-08-06 16:32:48
365
原创 UCX 的开源 gpunetio submodule 与 --with-doca 的关系分析
功能范围更窄,但核心 GDAKI one-sided RDMA 能力与 DOCA 版本一致,且 CUDA 设备端头文件相同。当前基于闭源 DOCA 的配置是合理的;若要迁移到开源 gpunetio,需要同步升级 UCX 版本并调整构建参数。升级 UCX 时,建议清理旧 DOCA GPUNetIO 相关库,或至少确认新 UCX 没有通过。)是基于其内部验证的 UCX 版本。,本质上仍是链接 DOCA SDK 的闭源 GPUNetIO。隔离,让不同进程分别加载不同版本的 UCX 及其依赖。
2026-08-06 13:47:55
294
原创 DOCA 简介与安装
DOCA 的工程功能定位是"数据中心的 CUDA"——它通过抽象 DPU 编程复杂性、提供前后向兼容的库与容器化服务,将 BlueField DPU 从一块"网卡加速卡"转变为一个"可编程的数据中心基础设施节点",其终极商业价值在于:以免费软件栈换取 DPU 硬件的生态锁定,使 NVIDIA 在 AI 工厂时代控制从计算(GPU)到网络(ConnectX/Spectrum)再到基础设施卸载(BlueField/DOCA)的完整数据平面。
2026-08-05 18:36:07
250
原创 哪些 GPU 可以支持 GDAKI
Turing(T4、RTX 8000)完全可以支持 GDAKI,不是 Ampere 独占。Volta(V100)目前也支持,但受 CUDA 版本天花板限制(< CUDA 13)。如果你的目标是实验 GDAKI,T4 或 RTX 8000 + ConnectX-6 是可行的硬件组合。如果你要部署生产环境,Ampere(A100)是 NVIDIA 当前的主力验证平台,稳定性和性能优化更成熟。
2026-08-05 14:09:53
164
原创 UCX v1.19.0 CUDA 依赖与 CUDA Hook 机制分析
对比项BistroReloc拦截层级函数入口机器指令ELF 重定位表是否需要动态链接否是静态链接 CUDA Runtime可有效拦截 Driver API 调用可能漏事件x86 默认是否启用是是单独使用是否可行是是能否完全替代两者不能完全替代 Bistro最终答案在 x86 平台上,可以通过只启用 Reloc、关闭 Bistro。但这不等价。
2026-08-05 12:33:01
297
原创 全文笔记01 - Ultra Accelerator Link Consortium Inc. (UALink) – UALink 128G DL/PL
框图如下所示。数据链路层位于事务层(Transaction Layer)与物理层(Physical Layer)之间。数据链路层把来自事务层的64 字节 Flit 打包成供物理层使用的 256 字节 Flit。数据链路层还在链路伙伴(link partner)之间提供一种消息服务,该服务在数据链路层发起并终止。该消息服务用于通告事务层速率、电源管理及其他功能。消息服务还在链路伙伴之间提供UART 风格的通信,供固件(F/W)通信使用。物理层 (Physical Layer)
2026-08-04 16:20:29
828
原创 git format-patch 、git diff 与 git apply
在 Git 中,生成和应用补丁(patch)是常见的协作方式,尤其适用于未直接推送到远程仓库的代码更改。
2026-08-04 12:30:54
172
原创 Holoscan SDK 可视化功能裁剪方案
主要使用了宏:(HOLOSCAN_ENABLE_VIZ)基于 holoscan-sdkmain分支(v4.5.0,commit017eb05,2026-07-30)实测分析编写。(已验证可干净应用)。
2026-08-04 12:24:07
360
原创 Holoscan 构建环境代码化的意义
传统方式:环境在人脑和文档里,构建是"手艺"。容器化方式:环境在 Dockerfile 里,构建是"可执行的规范"。产物没变——还是.so.hbin/;变的是得到产物的过程从不可复现变成了可复现。对于单人玩票的小项目,传统方式没问题;但对于一个要同时支持多种 CUDA/架构/GPU、由全球团队协作开发、最终部署到医疗级设备上的 SDK,容器化构建不是选择,是必需品。当然,如果真的想走传统路线,文档也留了门:参考顶层 Dockerfile 里的依赖清单在裸机装齐,然后直接——产物一模一样,只是踩坑自担。
2026-08-03 18:30:12
244
原创 全文 - Holoscan SDK 开发者
虽然用于构建 SDK 的 Dockerfile 目前不支持真正的交叉编译,但你可以在 x86_64 主机上使用模拟环境为开发者套件(arm64)编译 Holoscan SDK。:我们仅建议以下人员从源码构建 SDK:SDK 的开发者,或需要使用调试符号或其他未包含在已发布软件包中的选项来构建 SDK 的人员。(如可用,它在隔离环境中运行,不会污染你的 Python 安装),其次回退到 PATH 上已有的。IDE 启动后,开发容器将被构建,推荐的扩展将自动安装,同时 CMake 也会完成配置。
2026-08-03 17:47:51
318
原创 国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image
【代码】国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image。
2026-08-03 17:46:59
593
原创 FPGA 中 APB master 主控功能分析
这三个接口在 里都是 APB 从设备(peripheral),作用是把外部低速串行总线桥接到芯片内部的 APB 控制总线。它们本身不是“主机”,真正的主机是 APB 总线上的 master。所以通信链路是: 内部有 4 个内部 APB master(见 的 ):因此,SPI/I2C/UART 并不是某个“CPU 核”在直接操作,而是被这些 硬件状态机 + 主机远程指令 间接操作。 本身不直接驱动 I2C 引脚,而是通过 APB 配置 ,让 I2C 控制器完成读 EEPROM。除此之外,主机软件/
2026-07-31 17:09:42
310
原创 全文笔记 - Scalable Training of Mixture-of-Experts Models with Megatron Core
扩展混合专家(MoE)训练会引入稠密模型中不存在的系统挑战。由于每个 token 只激活一部分专家,这种稀疏性使总参数量的增长速度远超单 token 计算量,从而在内存、通信与计算三个维度上形成相互耦合的约束。优化其中一个维度往往会把压力转移到另一个维度,因此需要跨整个系统栈的协同设计。我们通过覆盖内存(细粒度重计算、卸载等)、通信(优化的调度器、重叠等)与计算(Grouped GEMM、算子融合、CUDA Graphs 等)的一体化优化来应对 MoE 训练的这些挑战。该框架还提供用于灵活多维并行的 Par
2026-07-31 12:55:14
1086
原创 全文笔记 - GPU-Initiated Networking for NCCL
现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。NCCL 2.28 引入了。
2026-07-30 23:58:06
339
原创 AMD/Xilinx 生态中的块级控制协议(Block-Level Control Protocol),以cmac 为例
拉闸即运转,数据来则动,数据尽则停,Host 不干预生命周期。对 CMAC 这类 100G 网络硬核而言,它是"自由运行内核"的标准签名,确保网卡从 FPGA 加载完成后即刻进入线速转发状态,无需 CPU 逐包调度。本文档提供 cmac 内核的概述。
2026-07-30 15:56:58
310
原创 Holoscan Sensor Bridge 应用指南(Applications)
在传统的基于整帧的处理中,必须先接收到完整的一帧,才能开始任何处理或显示。对于高分辨率传感器(例如 60fps 的 4K 相机、高密度激光雷达点云或雷达数据),这会引入显著的延迟,因为整个帧必须先被缓冲下来,然后才能开始处理。子帧处理把每一帧划分为多个水平条带(子帧),它们在到达时被独立处理。每个子帧包含原始帧中一组连续的行。例如,一幅 2160 行高的图像帧可以被划分为每 540 行一个的子帧,即每个完整帧包含 4 个子帧。同样的概念也适用于其他可以划分为水平条带的传感器数据类型。
2026-07-30 14:04:55
364
原创 Holoscan Sensor Bridge 入门指南(Getting Started)
Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。
2026-07-29 21:04:10
388
原创 全文 - QubiC: An open source FPGA-based control and measurement system for superconducting quantum inf
目的地参数是要控制的目标量子比特或读出通道,在门配置中命名为 dest。时序参数由脉冲起始时间(t0)和脉冲宽度(twidth)组成。载波频率(fcarrier)和初始相位(pcarrier)的值编码在载波参数中。脉冲幅度(amp)是 DAC 满量程的比例值。包络函数(env)可以是任何返回 NumPy 数组的 Python 函数(常用或自定义)。
2026-07-29 11:59:21
364
比利时的 鲁汶大学 计算机系教授 Philip Dutré 的全局光照教程,和他与合作者在 2002年 SIGGRAPH ppt
2022-09-17
LLVM IR MLIR: Scaling Compiler Infrastructure for Domain Specifi
2022-05-06
SSA_LLVMCookBook_DirectMethodSparseLinearSystem
2022-05-05
bootia32.efi
2018-04-07
chisel官方教程20201010版本.7z
2020-10-11
带几何解释的线性代数讲义
2020-12-02
英中双语版_flex与bison_pdf.7z
2020-11-03
Digital Design With Chisel_20201010edition.7z
2020-10-11
llvm_cookb_LLVM_IR骨架语法领进门资料.7z
2021-04-25
FIRRTL_spec_2020Oct_EditionPDF.7z
2020-10-19
Downloads.zip
2020-07-21
chi-SPECS-IN-ALL
2026-07-24
chi back protocol
2026-07-23
Full Bandwidth broadcast, reduce and scan with only - Logic Synthesis and Verification Algorithms
2025-11-15
ACPI spec 4.0 and 3.0
2024-08-24
bash-shell matrix-computations llvm-cook loader-linker sparse-ma
2024-01-23
Linux kernel 高并发开发
2024-01-14
mpi学习教程等-都志辉-配合下文https环境搭建
2023-12-29
代数多重网格理论资料 AMG AMGX原理
2023-09-28
opencl 学习资源pdf and source code
2023-05-22
常用数值算法集C语言与 Numerical Methods Using Matlab 4th Ed Mathews
2023-04-12
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅