自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1261)
  • 资源 (28)
  • 收藏
  • 关注

原创 nvCOMP 从开源到闭源的分水岭 2.2.0与基本原理概述

nvCOMP的API设计围绕易用性算法可交换性和极致性能这三个核心目标展开。其精髓在于分层设计:为普通用户提供简化的高级接口,为追求极致性能的专家提供底层的设备端扩展(nvCOMPDx)。

2026-08-11 18:29:45 26

原创 全文 - NVIDIA CuLitho and the Future of Inverse Lithography 与 cuLitho 简介

光学邻近校正(OPC, Optical Proximity Correction):修正光刻过程中因光的衍射和邻近效应导致的图案失真,确保掩模上的电路图案能准确投影到硅片上。逆光刻技术(ILT, Inverse Lithography Technology):通过逆成像算法求解最优掩模形状,以在先进制程下获得更高精度。掩模合成与全芯片修正(Mask Synthesis):包括全芯片邻近效应修正、模型构建与验证等。曲线流与曼哈顿流(Curvilinear & Manhattan Flows)

2026-08-11 14:56:12 42

原创 NVIDIA Agent Toolkits 简介与项目源码信息汇总

以下从开源内容/开源程度和第三方硬件算力公司接入方式两个维度,对 NVIDIA Agent Toolkit 进行系统性说明。维度实际情况开源程度代码完全开源(Apache 2.0),模型权重开放(OML),社区活跃;但生产级 NIM 和硬件加速库有商业/硬件绑定。第三方硬件接入可行性高。通过架构,任何支持 OpenAI-compatible API 的推理后端均可接入。接入最佳实践AMD/Intel/昇腾/Apple Silicon 均已有验证路径;

2026-08-11 13:51:39 86

原创 全文 - PhysicsNeMo README.md

NVIDIA PhysicsNeMo 是一个开源深度学习框架,用于构建、训练、微调和推理物理 AI 模型,采用面向 AI4Science(AI 驱动的科学研究)与工程领域的最先进 SciML 方法。PhysicsNeMo 提供 Python 模块,用于组合可扩展且经过优化的训练与推理流水线,帮助您探索、开发、验证并部署将物理知识与数据相结合的 AI 模型,实现实时预测。

2026-08-11 13:01:01 46

原创 一键构建 pytorch cpp lib 前端和 wheel

系统环境:ubuntu 22.04V100 GPU。

2026-08-10 23:15:51 48

原创 全文 - UALink_200G Rev 1.0 Specification 第 2 章 UPLI 接口定义与操作规则

UPLI 接口定义了三类厂商自定义命令(VDC):读类 VDC(ReqCMD=0x08h-0x0Fh)、写类 VDC(ReqCMD=0x2Ch-0x2Fh)和原子类 VDC(ReqCMD=0x3Ch-0x3Fh)。对于每个厂商自定义命令,以下 UPLI 请求接口信号应由厂商定义:ReqASI、ReqAddr、ReqLen、ReqAttr 和 ReqMetaData。UPLI 请求接口中的其余信号应保持与非 VDC 相同的功能。

2026-08-10 16:40:23 321

原创 gem5 garnet 的演进,原理,实验

在下创建新的拓扑文件,继承Topology类,定义init()方法连接 routers、NI 和 links。修改// 在 outportComputeCustom() 中实现自定义逻辑// 例如:基于下游 VC 空闲状态的自适应路由// ... 自定义算法 ...然后使用调用。

2026-08-10 15:15:05 440

原创 测试一个nv gpu 的健康度

针对。

2026-08-09 23:22:11 174

原创 全文 - UALink_200G Rev 1.0 Specification 第 1 章 引言

译自《UALink_200 Rev 1.0 Specification》(Ultra Accelerator Link Consortium Inc., 2025)第 1 章。

2026-08-09 18:51:23 272

原创 DOCA 文档

DOCA 框架提供了一套完整的软件套件,包含驱动程序、库、工具以及底层软件,用于与硬件设备及 BlueField 随附的默认操作系统进行交互。DOCA-Host和。组成部分说明DOCA SDK使开发者能够在 NVIDIA® BlueField® 网络平台上快速构建应用程序和服务,充分发挥业界标准 API 以及 NVIDIA BlueField DPU 和 SuperNIC 的强大能力。DOCA SDK 文档见此处。BlueField 平台软件。

2026-08-09 17:08:41 307

原创 从 vega 64 到 MI 100 ,AMD GPU 的裂变历史

核” = Compute Unit (CU),AMD GPU 的基本计算块。Vega 64= 64 CU,GCN 架构最后的游戏旗舰。MI 系列转向CDNA 纯计算架构,MI100 120 CU、MI200 128 CU/Die(MCM 双 Die),CU 数量与内部结构都发生了质变。MI100 的"大 bug"主要指电源管理失效和平台初始化兼容性差,加上早期 ROCm 软件生态不成熟,导致这款"首发 CDNA"产品在数据中心部署时踩坑颇多。

2026-08-09 15:38:05 302

原创 安装 ONNX Runtime

这个错误表明holoinfer。

2026-08-09 02:24:08 234

原创 给 Linux 加新硬盘的挂载命令

sdbsdb。

2026-08-08 22:33:37 164

原创 CUDA Graph 的原理与实现

当 kernel 本身只有几微秒时(如小 batch 推理、HPC 中细粒度通信、GXF/Holoscan 这类高频 pipeline),CPU 完全跟不上 GPU 的胃口——GPU 大量时间在"等 CPU 做饭"。它不改变任何 kernel 的语义,改变的是"谁在什么时候做调度决策"——从"CPU 每步做决策"变成"CPU 一次性决策、GPU 自主重放",代价是参数与拓扑的固化,换来的是数量级的调度开销削减和拓扑感知的自动并行。、kernel launch,把命令压入队列,GPU 顺序消费。

2026-08-08 21:51:30 147

原创 全文 - 图执行框架(Graph eXecution Framework, GXF)

GXF是 NVIDIA 推出的一个框架,提供基于组件的架构,专为开发硬件加速的计算图(compute graphs)而设计。该框架是其他高性能 SDK 的基础,例如DeepStream和Isaac ROS。例如,NITROS(NVIDIA Isaac Transport for ROS)利用嵌入在 ROS 2 节点中的 GXF 计算图,并通过优化的节点间传输机制,实现高效的 ROS 应用图。包位于 Isaac ROS NITROS 仓库中,该仓库持有 GXF 框架的二进制文件和头文件。本GXF。

2026-08-08 21:31:46 224

原创 git clone --mirror 完整迁移仓库的全流程

是迁移 Git 仓库最彻底、最可靠的方式,它会完整复制原仓库的所有引用(分支、标签、PR/MR 引用、notes 等),保证目标仓库与原仓库在 Git 对象层面完全一致。

2026-08-08 21:13:57 427

原创 ubuntu 22.04 -cuda12.8.2- holoscan-sdk-4.5-doca-ofed

1. 准备依赖# 2. 进入目录并安装(推荐 --all,跳过自带 UCX 避免后续冲突)# 3. 重启使内核模块生效# 4. 验证ibstat如果你只需要最基础的 RDMA 功能(不需要 OpenMPI、SHARP 等),可以改用。你的需求对应版本已装 OFED 24.10(同源驱动)需要 GPUNetIO(含(DOCA 3.x 要求 CUDA 13)V100 GPU(DOCA 3.x 的 GPUNetIO 针对 Ampere+ 优化,V100 本就受限)

2026-08-08 19:40:47 311

原创 高速串行链路的线路编码演进 和 Flit 级的纠错技术 -- pcie 6.4 的 1b/1b

PAM4 Gray+预编码让错误"单比特化" → 轻量交织 FEC 吃掉 99.9999% 的单符号错误(<2 ns)→ CRC-64 抓住漏网之鱼 → Replay 重传兜底。1b/1b 不是"放弃编码",而是把编码预算从"每比特征税"(8b/10b 的 25%)改为"每帧征税"(256 B 里 14 B ≈ 5.5%,且买到的是纠错而不仅是直流平衡)。

2026-08-07 15:19:03 352

原创 cx6 dx 网卡固件更新记录(mlxup不可用时)

mlxup版本有问题,用了 mlxfwmanager 进行更新。mlxup 内部也是调用 mlxfwmanager。mlxup 无法正确识别 版本,因为4.36 >2.0,它却认为小于。

2026-08-06 20:20:15 219

原创 Mellanox 网卡 更新固件的步骤

你的场景推荐方式命令单台服务器,已装 MFT,标准卡临时使用,不想装 MFT集群批量部署,开机自检修改启用升级 OFED/DOCA 顺便升固件(默认带固件更新)OEM 卡 / 需要指定版本 / 救砖mstflint如果你告诉我你的卡是标准 NVIDIA 卡还是OEM 定制卡(PSID 是否以MT_开头),以及当前 MFT/OFED 是否已安装,我可以给出最精简的一条命令。

2026-08-06 16:32:48 365

原创 UCX 的开源 gpunetio submodule 与 --with-doca 的关系分析

功能范围更窄,但核心 GDAKI one-sided RDMA 能力与 DOCA 版本一致,且 CUDA 设备端头文件相同。当前基于闭源 DOCA 的配置是合理的;若要迁移到开源 gpunetio,需要同步升级 UCX 版本并调整构建参数。升级 UCX 时,建议清理旧 DOCA GPUNetIO 相关库,或至少确认新 UCX 没有通过。)是基于其内部验证的 UCX 版本。,本质上仍是链接 DOCA SDK 的闭源 GPUNetIO。隔离,让不同进程分别加载不同版本的 UCX 及其依赖。

2026-08-06 13:47:55 294

原创 DOCA 简介与安装

DOCA 的工程功能定位是"数据中心的 CUDA"——它通过抽象 DPU 编程复杂性、提供前后向兼容的库与容器化服务,将 BlueField DPU 从一块"网卡加速卡"转变为一个"可编程的数据中心基础设施节点",其终极商业价值在于:以免费软件栈换取 DPU 硬件的生态锁定,使 NVIDIA 在 AI 工厂时代控制从计算(GPU)到网络(ConnectX/Spectrum)再到基础设施卸载(BlueField/DOCA)的完整数据平面。

2026-08-05 18:36:07 250

原创 NV-Q-Link 相关的代码信息收集

NVQLink 的。

2026-08-05 16:51:12 355

原创 哪些 GPU 可以支持 GDAKI

Turing(T4、RTX 8000)完全可以支持 GDAKI,不是 Ampere 独占。Volta(V100)目前也支持,但受 CUDA 版本天花板限制(< CUDA 13)。如果你的目标是实验 GDAKI,T4 或 RTX 8000 + ConnectX-6 是可行的硬件组合。如果你要部署生产环境,Ampere(A100)是 NVIDIA 当前的主力验证平台,稳定性和性能优化更成熟。

2026-08-05 14:09:53 164

原创 UCX v1.19.0 CUDA 依赖与 CUDA Hook 机制分析

对比项BistroReloc拦截层级函数入口机器指令ELF 重定位表是否需要动态链接否是静态链接 CUDA Runtime可有效拦截 Driver API 调用可能漏事件x86 默认是否启用是是单独使用是否可行是是能否完全替代两者不能完全替代 Bistro最终答案在 x86 平台上,可以通过只启用 Reloc、关闭 Bistro。但这不等价。

2026-08-05 12:33:01 297

原创 全文笔记01 - Ultra Accelerator Link Consortium Inc. (UALink) – UALink 128G DL/PL

框图如下所示。数据链路层位于事务层(Transaction Layer)与物理层(Physical Layer)之间。数据链路层把来自事务层的64 字节 Flit 打包成供物理层使用的 256 字节 Flit。数据链路层还在链路伙伴(link partner)之间提供一种消息服务,该服务在数据链路层发起并终止。该消息服务用于通告事务层速率、电源管理及其他功能。消息服务还在链路伙伴之间提供UART 风格的通信,供固件(F/W)通信使用。物理层 (Physical Layer)

2026-08-04 16:20:29 828

原创 git format-patch 、git diff 与 git apply

在 Git 中,生成和应用补丁(patch)是常见的协作方式,尤其适用于未直接推送到远程仓库的代码更改。

2026-08-04 12:30:54 172

原创 Holoscan SDK 可视化功能裁剪方案

主要使用了宏:(HOLOSCAN_ENABLE_VIZ)基于 holoscan-sdkmain分支(v4.5.0,commit017eb05,2026-07-30)实测分析编写。(已验证可干净应用)。

2026-08-04 12:24:07 360

原创 安装 sccache

是 Mozilla 开源的一款——可以把它理解为ccache的"现代化升级版"。

2026-08-03 21:25:51 127

原创 Holoscan 构建环境代码化的意义

传统方式:环境在人脑和文档里,构建是"手艺"。容器化方式:环境在 Dockerfile 里,构建是"可执行的规范"。产物没变——还是.so.hbin/;变的是得到产物的过程从不可复现变成了可复现。对于单人玩票的小项目,传统方式没问题;但对于一个要同时支持多种 CUDA/架构/GPU、由全球团队协作开发、最终部署到医疗级设备上的 SDK,容器化构建不是选择,是必需品。当然,如果真的想走传统路线,文档也留了门:参考顶层 Dockerfile 里的依赖清单在裸机装齐,然后直接——产物一模一样,只是踩坑自担。

2026-08-03 18:30:12 244

原创 docker build 与 docker buildx build 的应用场景

buildx。下面按场景展开。

2026-08-03 17:59:14 325

原创 全文 - Holoscan SDK 开发者

虽然用于构建 SDK 的 Dockerfile 目前不支持真正的交叉编译,但你可以在 x86_64 主机上使用模拟环境为开发者套件(arm64)编译 Holoscan SDK。:我们仅建议以下人员从源码构建 SDK:SDK 的开发者,或需要使用调试符号或其他未包含在已发布软件包中的选项来构建 SDK 的人员。(如可用,它在隔离环境中运行,不会污染你的 Python 安装),其次回退到 PATH 上已有的。IDE 启动后,开发容器将被构建,推荐的扩展将自动安装,同时 CMake 也会完成配置。

2026-08-03 17:47:51 318

原创 国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image

【代码】国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image。

2026-08-03 17:46:59 593

原创 FPGA 中 APB master 主控功能分析

这三个接口在 里都是 APB 从设备(peripheral),作用是把外部低速串行总线桥接到芯片内部的 APB 控制总线。它们本身不是“主机”,真正的主机是 APB 总线上的 master。所以通信链路是: 内部有 4 个内部 APB master(见 的 ):因此,SPI/I2C/UART 并不是某个“CPU 核”在直接操作,而是被这些 硬件状态机 + 主机远程指令 间接操作。 本身不直接驱动 I2C 引脚,而是通过 APB 配置 ,让 I2C 控制器完成读 EEPROM。除此之外,主机软件/

2026-07-31 17:09:42 310

原创 全文笔记 - Scalable Training of Mixture-of-Experts Models with Megatron Core

扩展混合专家(MoE)训练会引入稠密模型中不存在的系统挑战。由于每个 token 只激活一部分专家,这种稀疏性使总参数量的增长速度远超单 token 计算量,从而在内存、通信与计算三个维度上形成相互耦合的约束。优化其中一个维度往往会把压力转移到另一个维度,因此需要跨整个系统栈的协同设计。我们通过覆盖内存(细粒度重计算、卸载等)、通信(优化的调度器、重叠等)与计算(Grouped GEMM、算子融合、CUDA Graphs 等)的一体化优化来应对 MoE 训练的这些挑战。该框架还提供用于灵活多维并行的 Par

2026-07-31 12:55:14 1086

原创 全文笔记 - GPU-Initiated Networking for NCCL

现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。NCCL 2.28 引入了。

2026-07-30 23:58:06 339

原创 AMD/Xilinx 生态中的块级控制协议(Block-Level Control Protocol),以cmac 为例

拉闸即运转,数据来则动,数据尽则停,Host 不干预生命周期。对 CMAC 这类 100G 网络硬核而言,它是"自由运行内核"的标准签名,确保网卡从 FPGA 加载完成后即刻进入线速转发状态,无需 CPU 逐包调度。本文档提供 cmac 内核的概述。

2026-07-30 15:56:58 310

原创 Holoscan Sensor Bridge 应用指南(Applications)

在传统的基于整帧的处理中,必须先接收到完整的一帧,才能开始任何处理或显示。对于高分辨率传感器(例如 60fps 的 4K 相机、高密度激光雷达点云或雷达数据),这会引入显著的延迟,因为整个帧必须先被缓冲下来,然后才能开始处理。子帧处理把每一帧划分为多个水平条带(子帧),它们在到达时被独立处理。每个子帧包含原始帧中一组连续的行。例如,一幅 2160 行高的图像帧可以被划分为每 540 行一个的子帧,即每个完整帧包含 4 个子帧。同样的概念也适用于其他可以划分为水平条带的传感器数据类型。

2026-07-30 14:04:55 364

原创 Holoscan Sensor Bridge 入门指南(Getting Started)

Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。

2026-07-29 21:04:10 388

原创 全文 - QubiC: An open source FPGA-based control and measurement system for superconducting quantum inf

目的地参数是要控制的目标量子比特或读出通道,在门配置中命名为 dest。时序参数由脉冲起始时间(t0)和脉冲宽度(twidth)组成。载波频率(fcarrier)和初始相位(pcarrier)的值编码在载波参数中。脉冲幅度(amp)是 DAC 满量程的比例值。包络函数(env)可以是任何返回 NumPy 数组的 Python 函数(常用或自定义)。

2026-07-29 11:59:21 364

比利时的 鲁汶大学 计算机系教授 Philip Dutré 的全局光照教程,和他与合作者在 2002年 SIGGRAPH ppt

比利时的 鲁汶大学 计算机系教授 Philip Dutré 的全局光照教程,和他与合作者在 2002年 SIGGRAPH ppt

2022-09-17

RoofLine 理论的出处、起因、理论和示例

RoofLine 理论的出处、起因、理论和示例

2022-05-09

LLVM IR MLIR: Scaling Compiler Infrastructure for Domain Specifi

LLVM Language Reference Manual 即 LLVM IR MLIR: Scaling Compiler Infrastructure for Domain Specifi

2022-05-06

SSA_LLVMCookBook_DirectMethodSparseLinearSystem

static single assignment book, LLVM Cook book, Direct method sparse linear system solver suite sparse theory

2022-05-05

并行计算稀疏线性系统求解

并行计算稀疏线性系统求解

2022-03-07

bootia32.efi

ubuntu遇到32位EFI UEFI。如果安装ubuntu时提醒找不到bootia32.efi,那么将此文件放入U盘的/EFI/BOOT/中。会发现其中只有**64.efi

2018-04-07

x264-164.tar.gz

x264 c语言源代码

2022-01-02

chisel官方教程20201010版本.7z

资源许可证允许自由传播、修改,甚至是商业用途。 许可证网址: https://creativecommons.org/licenses/by-sa/4.0/ Share — copy and redistribute the material in any medium or format 因此可以放心自由使用

2020-10-11

带几何解释的线性代数讲义

带几何解释的线性代数讲义,讲解了解析几何以及线性代数工具下的几何定义,几何意义扩展线索下的代数定义,Euclidean Space,酉空间定义,正定矩阵的定义

2020-12-02

pexports-0.44.tar.gz

dll -> lib

2022-01-02

cuda_matrix_inverse.7z

计算逆矩阵并且验证计算结果,用cuda实现

2021-12-18

英中双语版_flex与bison_pdf.7z

Flex and bison are tools designed for writers of compilers and interpreters, although they are also useful for many applications that will interest noncompiler writers. Any application that looks for patterns in its input or has an input or command language is a good candidate for flex and bison.

2020-11-03

Digital Design With Chisel_20201010edition.7z

资源许可证书:可以自由传播、改变、甚至是商业用途。 https://creativecommons.org/licenses/by-sa/4. Attribution-ShareAlike 4.0 International (CC BY-SA 4.0) This is a human-readable summary of (and not a substitute for) the license. Disclaimer. You are free to: Share — copy and redistribute the material in any medium or format

2020-10-11

libQGLViewer-2.6.3.zip

这个版本有些难找,所以挂在这里。请先尝试网络下载。用于cgal开发所用,其他版本的没有编译通过。cgal

2017-09-28

llvm_cookb_LLVM_IR骨架语法领进门资料.7z

llvm cook学习资料——LLVM IR语言核心概念入门 核心内容汇总,基本应用命令入门,先用再分析,然后才能进一步结合编译原理看llvm编译器clang的实现代码。

2021-04-25

automata theory language.7z

automata理论资料,内容详实,解决了编程语言的设计,编译器的开发,自然语言语言翻译理论,习题链接,

2021-04-24

FIRRTL_spec_2020Oct_EditionPDF.7z

The ideas for FIRRTL (Flexible Intermediate Representation for RTL) originated from work on Chisel, a hardware description language (HDL) embedded in Scala used for writing highly-parameterized circuit design generators.

2020-10-19

Downloads.7z

SystemC from the Ground up (2nd edition) pdf and examples source code

2020-07-18

Downloads.zip

B3 和 B4 两个版本 WISHBONE System-on-Chip (SoC)Interconnection Architecturefor Portable IP Cores Brought to You By OpenCores

2020-07-21

CImg 2.0.5_pre092517

cimg.h 这个头文件在里面,以前对这个lib不熟悉,由于CGAL的原因才用到的。

2017-09-28

chi-SPECS-IN-ALL

CHI 和 NVSwitch 代表了两种截然不同的互联哲学: CHI 是通用缓存一致性协议,以目录/嗅探机制为核心,追求在异构多核系统中的严格一致性,适合 CPU 主导的通用计算。 NVSwitch 是专用数据交换引擎,以非阻塞交叉开关为核心,追求在 GPU 集群中的极致带宽和集体通信效率,通过牺牲严格缓存一致性换取硬件简化和性能提升。 两者的根本分歧在于一致性模型的选择:CHI 选择"硬件透明的一致性"(对软件隐藏复杂性),NVSwitch 选择"软件显式的一致性"(由 CUDA 编程模型管理同步)。这一分歧决定了它们在路由、组播、归约等机制上的本质差异。

2026-07-24

chi back protocol

NVLink 是跨封装、跨机架的包交换 fabric。CHI 出生时(Issue A)只是"片内 hub 接口",但演进方向在物理形态上持续向 NVLink 收敛:多接口/通道复制(E)、多 chiplet 遥测(G 的 DataSource 扩展)、直至 Issue G 全面聚焦 CHI C2C——Arm 官方的定位语已经变成"CHI is high speed, credited, and packetized, ideal for chiplets" ,这与 NVLink-C2C 的产品形态几乎重叠。

2026-07-23

nvswitch thinking

关于nvswitch 的应用原理与协议原理等

2026-07-22

链接器加载器-AXI BUS protocol-risc-v-ISA 手册

链接器加载器 AXI BUS protocol全系列 risc-v-ISA 手册

2026-05-22

量子编码之表面码入门教程

量子编码之表面码入门教程,量子编码之表面码入门

2026-05-05

chisel 数字电路设计 中文教程

chisel 数字电路设计 中文教程,pcie5.0 中文协议,图论经典教材bon

2026-03-13

AXI spec v1.0 and AMD MES spec

AXI spec v1.0 and AMD MES spec of gpu firmware

2026-01-19

Full Bandwidth broadcast, reduce and scan with only - Logic Synthesis and Verification Algorithms

Full Bandwidth broadcast, reduce and scan with only __ Logic Synthesis and Verification Algorithms

2025-11-15

网络协议设计的理论 protocol

网络协议设计背后的理论,例如:Protocol Engineering 等

2025-11-13

ACPI spec 4.0 and 3.0

Advanced Configuration and Power Interface Specification Hewlett-Packard Corporation Intel Corporation Microsoft Corporation Phoenix Technologies Ltd. Toshiba Corporation Revision 3.0a December 30, 2005 Advanced Configuration and Power Interface Specification Hewlett-Packard Corporation Intel Corporation Microsoft Corporation Phoenix Technologies Ltd. Toshiba Corporation Revision 4.0 June 16, 2009

2024-08-24

矩阵计算国际级大家之作,amd gpu mi300 isa spec

矩阵计算国际级大家之作,amd gpu mi300 isa spec

2024-06-21

bash-shell matrix-computations llvm-cook loader-linker sparse-ma

bash_shell matrix_computations llvm_cook loader_linker sparse_matrix block_Jacobi_svd regular_expression

2024-01-23

llvm编译器cookbook 中英 SSAbook

llvm编译器cookbook 中英 SSAbook

2024-01-14

Linux kernel 高并发开发

深入理解并行编程V2.0 中英文,示例源码网址: example source code: https://github.com/paulmckrcu/perfbook/tree/master

2024-01-14

mpi学习教程等-都志辉-配合下文https环境搭建

使用openmpi搭建mpi环境 https://blog.csdn.net/eloudy/article/details/135293911 另含: 链接器与加载器 gpu优化

2023-12-29

实分析 I II 英文版 可结合中文纸质书一起阅读

实分析 I II 英文版 可结合中文纸质书一起阅读

2023-10-20

代数多重网格理论资料 AMG AMGX原理

代数多重网格理论与算法and its application AMG AMGX 多份中英文资料,全面系统地说明了 多重网格算法的原理和历史脉络等

2023-09-28

opencl 学习资源pdf and source code

opencl programming guide opencl programming by example and source code opencl 2.1 spec

2023-05-22

常用数值算法集C语言与 Numerical Methods Using Matlab 4th Ed Mathews

常用数值算法集C语言 源程序源码 与 Numerical Methods Using Matlab 4th Ed Mathews pdf英文版

2023-04-12

Realistic Ray tracing pdf and source codes

Realistic Ray tracing pdf and source codes

2022-09-17

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除