自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(447)
  • 收藏
  • 关注

原创 9月10日直播16点丨CANN挑战赛赛题解析

2026-09-09 18:12:01 7

原创 代码侦探(第六期)开启|补全算子代码,赢华为手环等定制奖品

👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/730。📅 活动时间:9月9日至10月9日 24:00。

2026-09-08 20:49:59 180

原创 CANN本周快递,请查收!

本周摘要CANN代码仓上新:cannbotCANN技术活动:CANN NEXT系列开播CANN 社区进展直达开源社区:https://gitcode.com/cannCANN 上新。

2026-09-05 09:38:53 250

原创 【上新预告】CANN社区任务 9月9日10:00即将上新!35万+奖金池开放!

2026-09-04 17:57:04 203

原创 DeepSeek V4 950实践:整网统一低精度数据流优化突破推理性能瓶颈

HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和Kernel Launch,部分模块可达到。和MXFP8在权重、激活、KV Cache上的数值差异;

2026-09-04 14:32:55 189

原创 HiFloat4量化校准方案:HiGPTQ,HiAutoRound,HiFlatQuant

低比特量化是降低大语言模型推理成本和资源需求的重要手段。随着部署场景对显存占用、带宽压力和计算效率提出更高要求,量化研究正逐渐从 8-bit 进一步推进到 4-bit。HiFloat4(HiF4)是昇腾自研的一种 4-bit 数值格式,通过三级缩放机制显著扩展了低精度数值的动态范围,使其更适配大模型权重和激活中常见的动态范围分布。将高精度权重直接转化为 4 比特格式通常会带来量化误差。因此,量化校准成为进一步提升低精度模型性能的关键环节。

2026-09-04 11:41:53 325

原创 HiF8、FP8、MXFP8_MXFP4怎么选?一文看懂昇腾950低精度技术选型

下面这张图可以支撑:HiF8和MXFP8在KV cache上均能保持较高量化保真度,KV cache不是HiF8相比MXFP8的主要精度风险来源,在KV cache SQNR上,未观察到HiF8相比 MXFP8的系统性退化,两种格式整体稳定在相近水平。该结果表明,HiF8在KV cache量化中未引入额外的小值置零风险,并可能相比MXFP8更好地保留低幅值cache信息,HiF8在KV cache数值保真度和小值保留方面均与MXFP8基本对齐,甚至在部分层具备更低置零率优势。但低精度也带来挑战。

2026-09-04 11:09:11 456

原创 AMCT-LLM 量化操作指南 | 社区任务等你来参与

大模型量化是推理优化的关键能力之一。通过降低权重和激活的数值精度,量化可以减少模型存储、显存占用和计算开销,是大模型在实际业务中高效部署的重要手段。AMCT 是 CANN 社区提供的模型压缩与量化工具,面向昇腾 AI 处理器支持 LLM 模型高效量化,覆盖 BF16 基线评估、PTQ 离线数据提取、PTQ 参数训练、fake quant 精度评估等典型流程。本文与配套使用,提供一份可参考、可跑通的 AMCT-LLM 量化操作流程,帮助开发者快速理解基本工作流,降低上手成本。

2026-09-03 15:21:33 171

原创 CANN社区任务再上新!9月2日10:00开启任务报名,18个任务上线,45万+奖金池开放!

2026-09-01 20:34:42 237

原创 代码侦探(第五期)开启|补全算子代码,赢华为手环等定制奖品

📅 活动时间: 9月1日至10月1日。

2026-09-01 16:35:13 211

原创 CANN本周快递,请查收!

CANN技术活动:CANN挑战赛、HCCL通信库创新大赛火热报名中CANN社区进展直达开源社区:https://gitcode.com/cann竞 赛 进 行 时【2026 华为算法挑战赛_CANN挑战赛】开启预报名!面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!【2026 CANN-HCCL通信库创新大赛】东北赛区火热报名中,证书+丰厚奖金等你赢取!欢迎广大学生报名参加!

2026-08-29 12:04:52 197

原创 【上新预告】9月2日22个CANN社区任务上新!单个任务最高激励达7万+!

CANN社区任务再上新!9月2日10:00开启任务报名。22个任务上线,60万+奖金池开放!扫码参与活动报名,抢先了解任务详情。

2026-08-28 20:24:30 244

原创 8月27日19点开播丨视触融合、灵巧操作到世界模型:具身智能从算法创新到工程落地实践

2026-08-26 18:40:17 37

原创 8月26日CANN社区任务上新!35个任务上线,85万+高额奖金池开放!

2026-08-25 21:17:23 173

原创 代码侦探|特别期 · 限时问答,50份定制背包、冲锋衣等你领,手慢无!

👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/559。📅 活动时间: 8月25日至9月1日。

2026-08-25 19:42:25 21

原创 8月26日19点开播丨昇腾NPU原生训练的三维重建基础模型与4D世界模型

2026-08-25 19:20:37 223

原创 8月25日19点开播丨迈向通用具身操作--训练时计算与推理时计算

2026-08-24 18:18:28 31

原创 CANN本周快递,请查收!

是面向生命科学领域、负责建设昇腾原生算子库的开源兴趣小组,算子仓为bio-ops-molecule。SIG聚焦多组学数据处理、生物分子模拟和生物基础模型训练等场景,通过高性能行业算子解决计算效率、显存占用和数据访存等底层性能瓶颈。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。

2026-08-22 08:00:00 463

原创 ​8月24日19点直播丨Crypto for AI:在不信任的世界里,实现可信的智能

2026-08-21 17:26:26 33

原创 AMCT structured pruning: MoE expert selection, method and measurement

【代码】AMCT structured pruning: MoE expert selection, method and measurement。

2026-08-21 16:58:09 328

原创 【8月26日上新预告】35个CANN社区任务上线,85万+高额奖金池开放!

2026-08-21 10:33:40 236

原创 【CANN经验传递】HiF8 × Safe-Pruner:剪掉一半Token,8-bit VLA依然无损

需要注意的是,FLOPs会独立于数值精度统计multiply-accumulate operations:它反映的是token剪枝带来的FLOPs降低,但并不能体现HiF8带来的收益,例如低比特宽度带来的memory和bandwidth节省,以及低比特矩阵计算单元上的更高吞吐。因此,它能够在不依赖细粒度per-token / per-block scale的情况下,同时兼顾宽动态范围和高精度表示,也就是说,仅使用最简单的单一per-tensor scale即可完成有效量化。其主要特性可以概括如下。

2026-08-20 19:32:00 388

原创 【CANN经验传递】从一张查找表到 4GB/s:HiFloat8 Cast 算子的工程化之路

但 FP16/BF16 一共只有 65536 种位模式,HiFloat8 只有 256 种——干脆在 host(CPU)上预先把所有结果算出来打成一张表,device 上只剩"查表 + 写回",又快又简单。精度侧覆盖了 FP16/BF16 全 65536 个位模式的 roundtrip、HiFloat8 全 256 个值的 decode,以及 ±0、±Inf、NaN、subnormal 的边界场景。半空间 LUT 多了 4-5 条标量指令,但省下的 UB 直接换成更大的 tile,整体吞吐反而上去了。

2026-08-20 18:44:32 348

原创 8月20日19点直播丨AMCT-Pruning结构化剪枝技术

💡提示:本场直播为外籍讲师全程英文分享,配有双语字幕,内容具有一定技术门槛,欢迎感兴趣的开发者观看。

2026-08-19 18:29:02 35

原创 代码侦探挑战赛(第四期)开启丨补全算子代码赢定制背包、冲锋衣等奖品!

📅 活动时间: 8月19日至8月26日。

2026-08-19 09:28:23 22

原创 8月19日晚上19点直播丨AMCT-LLM量化能力发布解读:主流网络与PTQ算法实践

2026-08-17 20:17:39 27

原创 【2026年8月】 CANN开源开发者满意度有奖调研

2026-08-17 15:49:14 25

原创 PyPTO Professional模式: PyPTO-Pro易用性的来源

PyPTO Professional 的赌注是:算子开发者应该把时间花在「切多大的块、开几级流水、Buffer 怎么摆」上,而不是花在「这个 offset 算对了吗、这个 event id 配对了吗」上。前者是创造性的、决定性能上限的工作;后者是机械的、只决定你今晚能不能下班的工作。PyPTO Professional 把后者全部接管,同时一寸不让地把前者留给你——因为想摸到理论峰值 0.9x 以上,方向盘就必须在人手里。✅ 手写过指令级 Kernel,被set_flagwait_flag折磨过;

2026-08-16 17:16:56 327

原创 CANN社区任务8月17日正式上新!6大任务上线,单个任务最高8.7万+激励!

2026-08-16 10:30:09 221

原创 PyPTO Professional模式: PyPTO算子开发体验增强

PyPTO Professional 的赌注是:算子开发者应该把时间花在「切多大的块、开几级流水、Buffer 怎么摆」上,而不是花在「这个 offset 算对了吗、这个 event id 配对了吗」上。前者是创造性的、决定性能上限的工作;后者是机械的、只决定你今晚能不能下班的工作。PyPTO Professional 把后者全部接管,同时一寸不让地把前者留给你——因为想摸到理论峰值 0.9x 以上,方向盘就必须在人手里。✅ 手写过指令级 Kernel,被set_flagwait_flag折磨过;

2026-08-14 21:38:38 369

原创 AMCT-LLM 如何打通大模型低比特量化全流程

在 AI 大模型时代,模型部署时会遇到容量压力、带宽与吞吐压力和工程适配压力。同时,本可以收敛成一条工具链的工作被分散在各个流程中,进而导致在适配不同模型时做重复工作。如何低成本的部署模型,如何把模型量化收敛成一条统一的工作流,是这个时代需要解决的问题。AMCT-LLM 是一款面向大语言模型低比特量化的模型压缩工具,将模型适配、精度评估、量化优化与部署导出收敛为统一工作流。

2026-08-14 17:33:32 322

原创 CANN社区任务8月17日上新!6大任务上线,32万+超大奖金池已就位!

2026-08-14 14:04:30 184

原创 静态 Shape 多流并行增强:让图中的任务真正并行

静态 Shape 多流并行增强模块并不追求更多 Stream,而是追求更多有效并行。逻辑流拆解负责找到图中的并行空间,物理流合并负责生成可执行的多流候选,Profiling 和硬件资源约束负责把逻辑并行修正为硬件可承载的真实重叠,最后再通过 Device 实测选择端到端更优的方案。判断多流优化是否有效,最终只需要回到三个问题:任务是否真正重叠,资源是否能够承载,以及端到端性能是否真正改善。

2026-08-12 18:41:19 357

原创 代码侦探挑战赛(第三期)开启丨补全算子代码赢定制背包、冲锋衣等奖品!

👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/540。📅 活动时间: 8月12日至8月19日。

2026-08-11 16:33:24 27

原创 CANN 开发者 Meetup 南京站|轻量开发专场,线下技术沙龙正式开启报名

CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。

2026-08-10 20:42:02 232

原创 代码侦探挑战赛(第二期)开启丨补全算子代码赢定制背包、冲锋衣等奖品!

👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/531。📅 活动时间: 8月6日至8月13日。

2026-08-06 16:37:55 163

原创 Agent-Friendly 范式探索 --- 基于CANNBot的高性能复杂算子生成

CANNBot-DSL正是基于此考虑:把那些复杂、易错、却又不左右性能的动作逐一建模,沉淀为一层架设在昇腾稳定Ascend C之上的软件抽象,让 CANNBot 彻底从繁冗细节中解放出来,回到算法与数据流的主场,心无旁骛,尽展所长。为突破Agent开发复杂高性能算子的各类难题,CANNBot-DSL方案通过昇腾硬件友好的协程范式、框架自动管理同步、Agent友好的API封装、尾块自动处理、性能优化关键因子拆解和求解器寻优等多种机制攻克开发痛点,从稳定性、开发难度、硬件适配、运算效率多方面带来增益。

2026-08-05 20:40:00 275

原创 CANN Meetup杭州站・模型专场开启报名

GLM-5.2 KV Offload 系统优化实践Agent 赋能模型部署优化:Hy3 昇腾推理实践PyPTO 编程框架与 Agent 算子生成能力面向昇腾 950DT 的 DSpark 推理实现与性能优化Longcat 2.0:推理低时延优化SanaVideo 模型 NPU 单卡部署与性能优化实践。

2026-08-04 10:10:52 227

原创 CANN本周快递,请查收!

SIG 主要沉淀面向 6G AI RAN 的典型任务样例,覆盖时变信道表征与建模、信道估计、端到端无反馈MIMO预编码与多流传输、跨场景智能定位与多基站协作传输等方向,并可进一步拓展至基站智慧节能、移动性管理等 AI for RAN 应用。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首次通过issue、pr、答题、社区互动或文章等方式反馈有价值意见、建议、需求、报错、成果等。

2026-08-02 10:24:16 333

原创 基于 PyPTO 与 Agent,2周完成模型 QAT 算子开发与优化

QAT 算子的开发实践验证了 PyPTO 的简单易用:用高层张量 API 表达算法逻辑,用tile_shape和等参数完成性能调优。在此基础上,Agent 可以先围绕公式和张量关系快速完成功能实现,再根据 profiling 结果调整少量参数完成优化,2周便完成 QAT 算子的开发、调优和模型接入,实现了模型吞吐性能的显著提升。

2026-07-30 19:37:12 344

面向Ascend 950, 加速开发、释放生产力的必备利器

面向Ascend 950, 加速开发、释放生产力的必备利器

2026-03-26

Ascend 950 场景驱动下的算子编程语言选型

内容概要:本文围绕下一代硬件架构下的AI算子编程语言选型问题,系统分析了不同编程语言与API层级如何满足高易用性、高性能及跨平台兼容等多维开发诉求。文章重点介绍了Ascend C、PyPTO、Triton-Ascend和TileLang等多种编程语言及其在SIMT/SIMD矢量计算、低比特矩阵乘、融合算子创新等典型场景中的技术实现路径,展示了各语言在不同抽象层级上的能力支撑,如Ascend C的多级API体系、PyPTO的自动优化与VF融合、Triton的编译器自动使能硬件特性以及TileLang的软硬件协同设计。同时,针对算法验证、性能调优和异构部署等实际场景,提出了具体的语言选型建议。; 适合人群:具备AI算子开发经验的研发人员,尤其是从事高性能计算、深度学习框架优化、异构编程的语言与编译器开发者,以及关注昇腾生态的技术工程师。; 使用场景及目标:①在算法快速验证阶段,选用PyPTO或Triton-Ascend提升开发效率;②在追求极致性能的部署阶段,采用Ascend C底层API或TileLang专家模式精细控制硬件资源;③在跨平台迁移与兼容性需求下,利用PyPTO、Triton或TileLang的抽象能力实现NPU/GPU间的可移植性; 阅读建议:本文技术深度较高,建议结合昇腾CANN社区资源与实际开发环境同步实践,重点关注各语言在具体硬件特性(如SIMT、MXFP8、CV直连通路)上的映射机制,并通过案例理解从算法表达到硬件执行的全流程优化逻辑。

2026-03-26

面向Ascend 950,CANN技术架构的变与不变

面向新一代硬件,CANN技术架构的变与不变

2026-03-26

探索Ascend 950的性能天花板

探索Ascend 950的性能天花板

2026-03-26

CANN 算子开发全链路体验升级

内容概要:本文介绍了CANN(Compute Architecture for Neural Networks)在算子开发全链路中的三大核心体验升级:算子编程易用性提升、运行时调度接口优化以及调优Profiling能力增强。重点包括新增NDDMA多维非连续数据搬运能力,支持转置、广播、Padding等复杂场景的高效实现;引入CV直连通路(UB2L1/L0C2UB)以提升融合算子性能;完善算子代际兼容策略,确保从910系列到950芯片的平滑迁移;优化KernelLaunch接口,降低核间同步开销并支持超时控制与批量调度;新增Count Notify机制简化1对N同步编程;在调优方面,大幅提升Profiling采集频率至10kHz,支持CCU性能监控、Pipe流水图可视化、PC采样定位阻塞指令及SIMT寄存器细粒度分析,全面提升算子开发调试效率与性能优化能力。; 适合人群:从事AI芯片底层开发、高性能算子开发的技术人员,具备一定Ascend C/C++编程经验及硬件架构理解能力的研发工程师;适用于深度参与CANN生态开发、模型迁移与性能调优的专业开发者。; 使用场景及目标:①利用NDDMA和CV直连通路开发高效融合算子,提升数据搬运与计算性能;②通过运行时接口优化实现低延迟、高可靠的任务调度与同步;③借助增强的Profiling工具链进行端到端性能瓶颈分析与定位,支撑高性能AI算子的设计与调优;④完成旧版算子向Ascend 950等新型硬件的兼容迁移。; 阅读建议:建议结合GitCode上的完整样例代码实践学习,重点关注NDDMA参数配置、Fixpipe接口使用、Count Notify编程模型以及Profiling工具的实际应用,配合硬件架构文档深入理解各项优化特性的底层原理。

2026-03-26

面向下一代硬件的性能调优

Profiling是开发者进行NPU性能调优的重要工具,本次课程向开发者介绍下一代芯片面向整网和算子性能调优提供的新特性。

2026-03-12

PyPTO 模型融合算子实操

作为PyPTO系列的最后一讲,本次分享聚焦大模型的融合算子的开发全流程;从算子设计,到算子开发,再到性能优化,展现PyPTO的实操风采。

2026-03-12

PyPTO IDE调优工具实操

PyPTO Toolkit是一款PyPTO框架全流程辅助工具,提供包括编译、运行时状态的可视化、算子开发作业流的作业能力,使能开发者快速建立对PyPTO框架的理解,提升算子开发和调试调优效率。

2026-03-12

PyPTO:Tensor 的算子编程范式

PyPTO是一种兼顾开发效率与运行性能的编程框架,它既简化了算子和模型的开发流程,又通过编译优化保证了高性能。其核心机制是将高层次的Tensor计算图,自动转化为可并行的Tile计算,从而生成高效的可执行代码。

2026-03-12

PyPTO:Hello, World!

作为 PyPTO 系列分享的第一讲,本次分享将为开发者介绍PyPTO的基本概念与环境安装,让开发者能够写出 PyPTO的Hello, World.

2026-03-12

Ascend C算子编译与调试调优能力概述

主要介绍 AscendC算子编译方式以及配套的调试调优能力,助力算子开发者快速上手,帮助开发者快速定位算子问题,实现高性能的算子,提升CANN算子开发效率。

2026-03-12

基于下一代硬件的Ascend C Reg矢量编程

基于下一代硬件的Ascend C Reg矢量编程

2026-03-04

基于下一代Ascend平台的Ascend C算子编程概述

基于下一代Ascend平台的Ascend C算子编程概述

2026-03-03

基于下一代硬件的Ascend C SIMD与SIMT混合编程

基于下一代硬件的Ascend C SIMD与SIMT混合编程

2026-03-04

基于下一代Ascend平台的SIMT编程介绍

基于下一代Ascend平台的SIMT编程介绍

2026-03-03

ScaleBox面向昇腾环境的高效代码强化学习沙盒环境实践

内容概要:本文介绍了ScaleBox——一个面向昇腾(Ascend)环境的高效代码强化学习沙盒环境,旨在解决大模型在代码强化学习(Code RL)中面临的验证效率低、评估不一致及平台适配难等问题。ScaleBox通过构建可扩展的分布式代码执行沙盒,支持多机部署、负载均衡、单元测试并行与实例级并行,显著提升了验证吞吐能力。它兼容主流强化学习框架(如verl),并深度适配昇腾平台的CANN生态,提供统一的训练接口和一键式多基准评估(如HumanEval、LiveCodeBench)。文章还展示了基于DeepSeek-R1和Qwen3系列模型在昇腾环境下的Code RL训练实践,验证了其在长上下文、大规模任务中的高效性与稳定性。; 适合人群:具备一定深度学习与大模型训练背景,从事AI工程化、模型后训练优化或Code RL研究的研发人员,尤其适用于在国产化算力平台(如昇腾)上开展工作的技术人员。; 使用场景及目标:① 构建高并发、低延迟的代码验证系统以支持大规模强化学习训练;② 在昇腾平台上实现端到端的Code RL训练流程,提升训练效率与评估一致性;③ 推动大模型在代码生成、自修复、测试预测等场景中的实际落地应用; 阅读建议:此资源强调系统设计与工程实践的结合,建议读者结合开源项目(cann-recipes-train 和 ScaleBox)中的代码样例、Docker镜像与部署脚本进行实操,重点关注数据构建、奖励函数定义与分布式沙盒集成等关键环节,并积极参与社区共建以推动生态发展。

2026-02-24

CANN一站式开发平台全面公测

CANN一站式开发平台全面公测

2026-02-24

轻量化图模式后端npugraph-ex

轻量化图模式后端npugraph-ex

2026-02-24

CANN ops-samples仓开源介绍

CANN ops-samples仓开源介绍

2026-02-24

TileLang-AscendDeveloper模式

TileLang-AscendDeveloper模式

2026-02-24

能源化工行业基于昇腾生态的科研算子适配与应用

能源化工行业基于昇腾生态的科研算子适配与应用

2026-04-23

面向Ascend950的8bit量化矩阵乘性能建模与优化方法论

面向Ascend950的8bit量化矩阵乘性能建模与优化方法论

2026-04-23

面向Ascend 950的AscendC SIMD&SIMT编程实践

面向Ascend 950的AscendC SIMD&SIMT编程实践

2026-04-23

具身智能VLA模型在昇腾平台的适配优化关键技术实践

具身智能VLA模型在昇腾平台的适配优化关键技术实践

2026-04-23

NPU模型优化Agent Skill:端到端优化闭环实践

NPU模型优化Agent Skill:端到端优化闭环实践

2026-04-23

HCCL 北极星工具助力 Ascend950 集合通信高效开发

HCCL 北极星工具助力 Ascend950 集合通信高效开发

2026-04-23

Ascend 950 HiF8模型量化技术的训推实践

Ascend 950 HiF8模型量化技术的训推实践

2026-04-23

AI赋能化工工艺流程模拟与优化

AI赋能化工工艺流程模拟与优化

2026-04-23

TileLang典型算子性能优化

TileLang典型算子性能优化

2026-04-23

CANNBot 开发进阶:TileLang-Ascend 算子开发实操

CANNBot 开发进阶:TileLang-Ascend 算子开发实操

2026-04-23

CANNBot开发进阶:PyPTO 算子开发实操

CANNBot开发进阶:PyPTO 算子开发实操

2026-04-23

CANNBot开发进阶:Ascend C算子开发实操

CANNBot开发进阶:Ascend C算子开发实操

2026-04-23

CANNBot入门:从0到1生成你的第一个算子

CANNBot入门:从0到1生成你的第一个算子

2026-04-23

CANNBot发布:畅享算子开发新旅程

CANNBot发布:畅享算子开发新旅程

2026-04-23

Ascend HiFloat8 Al训练和推理

Ascend HiFloat8 Al训练和推理

2026-04-09

HiFloat4 Format for Language Model Inference

HiFloat4 Format for Language Model Inference

2026-04-09

基于Ascend 950的CUBE编程技术

内容概要:本文系统介绍了基于下一代昇腾AI处理器硬件架构的Cube编程技术,重点围绕CUBE计算单元的微架构升级,详细解析了存储能力增强、数据通路重构、新型指令支持、低比特数据类型(如FP4、FP8)、新增专用存储单元(SSBuffer)及核间同步机制等关键技术变革。文章对比了当代与下一代CUBE编程差异,深入讲解了DN/NZ数据格式转换、MXFP量化矩阵乘、DualDst双目标输出模式、CV融合流水优化等核心特性,并配套呈现基础API与高阶Tensor API的编程方法及实操案例,如MatmulV3与FlashAttentionGrad(FAG)算子开发,帮助开发者掌握面向新硬件的算子设计与性能调优能力。; 适合人群:具备Ascend C编程基础、熟悉当代CUBE算子开发流程,且有昇腾芯片架构认知的研发人员,尤其是从事高性能算子开发与AI模型加速的工程师; 使用场景及目标:①理解下一代CUBE硬件升级对算子编程的影响,掌握新型API的使用方式;②开发支持FP4/FP8低比特计算的高效矩阵算子;③实现CV融合算子的流水并行与性能优化,提升端到端计算效率; 阅读建议:此资源以架构演进驱动编程范式升级为主线,建议结合提供的代码示例与开源样例仓实践,重点关注数据搬运路径、LoadData与Fixpipe新参数配置、核间同步模式切换等关键环节,并通过调试不同tiling策略验证性能增益。

2026-03-30

PTO ISA教你如何快速上手昇腾950

内容概要:本文介绍了PTO ISA(Parallel Tile Operation Instruction Set Architecture)——昇腾芯片的虚拟指令集,重点讲解其在昇腾950芯片上的应用与编程方法。文档详细阐述了PTO如何通过层次化多粒度指令集(块指令与微指令结合)实现对达芬奇架构硬件能力的抽象与透传,在保证高性能的同时达成跨平台兼容性。内容涵盖PTO抽象机的工作机制、标量/向量/块指令的编程模型、内存层级与数据流动原理,并通过手写矩阵乘和Flash Attention等典型算子示例,展示如何高效进行底层优化。此外,文档还展示了PTO与AI Agent结合可自动生成接近专家手写水平的高性能算子代码,显著提升开发效率。; 适合人群:具备一定AI框架和硬件基础知识的算法工程师、系统程序员及高性能计算研发人员,尤其是从事昇腾平台算子开发、模型优化或AI编译器研究的技术人员。; 使用场景及目标:①掌握昇腾950芯片底层编程原理,理解Roofline模型与局部性优化策略;②学习如何使用PTO编写高性能定制算子,如矩阵乘、FlashAttention等;③探索基于PTO+Agent的自动化算子生成路径,提升开发效率;④为构建跨平台、高兼容性的AI算力生态提供技术支持。; 阅读建议:此资料强调理论与实践结合,建议读者配合PTO开源项目(GitCode/GitHub)动手实验,深入理解指令调度、内存布局与并行优化机制,并关注社区更新以获取最新工具链与案例支持。

2026-03-26

HCCL集合通信专用引擎CCU技术介绍

HCCL集合通信专用引擎CCU技术介绍

2026-03-26

CANN HiF8格式和技术直播

CANN HiF8格式和技术直播

2026-03-26

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除