<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[newBorn_1991的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/newBorn_1991</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; newBorn_1991]]></copyright><item><title><![CDATA[ops-cv NMS后处理硬件排序单元调用与阈值优化实战]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/157834966</link><guid>https://blog.csdn.net/newBorn_1991/article/details/157834966</guid><author>newBorn_1991</author><pubDate>Sat, 07 Feb 2026 07:16:32 +0800</pubDate><description><![CDATA[摘要：本文深入探讨了目标检测模型中NMS（非极大值抑制）后处理的硬件加速优化方法。通过分析ops-cv中non_max_suppression.cpp的实现，详细介绍了如何利用aicpu_sort硬件单元加速排序计算，并结合YOLOv8案例提供完整的IoU阈值调优方案。实验数据显示，优化后的NMS在NPU上可实现3-5倍的性能提升，同时保持检测精度稳定。文章还包含环境配置、调优策略、常见问题解决等实用内容，为高并发推理场景提供了有效的技术解决方案。]]></description><category></category></item><item><title><![CDATA[ops-transformer RoPE位置编码 复数旋转硬件加速实战]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/157834860</link><guid>https://blog.csdn.net/newBorn_1991/article/details/157834860</guid><author>newBorn_1991</author><pubDate>Sat, 07 Feb 2026 07:12:29 +0800</pubDate><description><![CDATA[本文深度剖析了cann项目中ops-transformer的RoPE位置编码优化实现，重点解析了rotary_position_embedding.cpp中的关键技术。通过预计算sin/cos表、向量指令融合和NPU硬件加速等创新方法，在LLaMA模型推理中实现18%的吞吐提升。文章详细介绍了分层架构设计、内存优化策略和指令级并行技术，并提供了完整的性能对比数据和实战代码示例。针对企业级应用场景，分享了动态频率调整、混合精度计算等13年经验积累的优化技巧，同时给出了常见问题的解决方案。这些优化成果为AIGC]]></description><category></category></item><item><title><![CDATA[图调试工具中间张量导出与精度比对实战]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/157812626</link><guid>https://blog.csdn.net/newBorn_1991/article/details/157812626</guid><author>newBorn_1991</author><pubDate>Fri, 06 Feb 2026 21:00:21 +0800</pubDate><description><![CDATA[本文深入解析CANN图引擎GE的调试工具链核心组件graph_debugger.cpp，重点介绍中间张量导出与精度比对技术。通过非侵入式插桩设计，该工具实现了零性能损耗的生产模式和全量数据采集的调试模式无缝切换。文章详细讲解了张量数据采集和序列化机制的关键算法实现，包括零拷贝采集、智能采样和异步持久化等核心功能。以Diffusion模型为例，展示了从环境配置到自动化分析流水线的完整调试流程，包括关键层选择、精度指标计算和常见问题解决方案。同时分享了企业级实践中的分层调试策略和智能基线管理等高级技巧，为开发者]]></description><category></category></item><item><title><![CDATA[Triton GE Backend推理引擎集成实战解析]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/157812561</link><guid>https://blog.csdn.net/newBorn_1991/article/details/157812561</guid><author>newBorn_1991</author><pubDate>Fri, 06 Feb 2026 20:57:02 +0800</pubDate><description><![CDATA[本文深入解析Triton推理服务器中GEBackend的实现链路，重点从TRITONBACKEND_ModelInstanceExecute到aclmdlExecute的完整调用流程。通过源码分析揭示了GE推理引擎的关键技术：1）零拷贝数据传输和动态批处理优化；2）计算图优化与内存复用机制；3）流水线并行执行设计。实测数据显示，该架构在ResNet50等模型上可提升吞吐45%、降低延迟30%。文章提供了从环境配置、模型转换到性能调优的完整部署指南，并针对常见问题给出解决方案。最后探讨了企业级应用中的模型分区]]></description><category></category></item><item><title><![CDATA[庖丁解牛：使用Aclnn接口调用一个算子的完整生命周期]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155992818</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155992818</guid><author>newBorn_1991</author><pubDate>Wed, 17 Dec 2025 13:58:23 +0800</pubDate><description><![CDATA[本文深入解析了华为昇腾Aclnn接口的算子完整生命周期管理，从算子描述与编译到执行优化。通过LpNormV2Custom算子实例，详细展示了JSON描述符定义、msopgen工具生成框架、两阶段执行模型（描述与执行分离）等关键技术环节。文章包含5个Mermaid流程图、性能数据对比和企业级错误处理模式，重点介绍了向量化计算、内存管理和Pybind11封装等优化策略。最后展望了编译器智能化、统一编程模型等未来趋势，为开发者提供了从算子开发到生产部署的完整技术图谱。]]></description><category></category></item><item><title><![CDATA[矢量计算的交响乐：Ascend C向量编程范式与指令级并行优化]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155992777</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155992777</guid><author>newBorn_1991</author><pubDate>Tue, 16 Dec 2025 23:32:28 +0800</pubDate><description><![CDATA[技巧1：指令混合优化（Instruction Mix Tuning）// 平衡计算与内存指令比例（理想比例：2:1）// 每个循环迭代包含：// 2个内存操作 + 4个计算操作 = 理想比例// 内存指令1// 内存指令2// 计算指令1// 计算指令2// 计算指令3// 计算指令4// 内存指令3技巧2：数据预取策略（Software Prefetching）// 四级预取策略：L1/L2/L3/DDR// 预取距离i < size;i += 8) {]]></description><category></category></item><item><title><![CDATA[驾驭昇腾CANN异步流水线从算子优化到系统级性能跃迁]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155861298</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155861298</guid><author>newBorn_1991</author><pubDate>Fri, 12 Dec 2025 20:13:14 +0800</pubDate><description><![CDATA[本文深入解析华为昇腾CANN架构中主机与设备交互的核心技术，重点探讨异步执行模型、Stream并行机制、零拷贝内存管理和流水线优化等关键技术。通过分层解耦设计理念，CANN实现了计算与通信的高效重叠，实测性能提升达3倍以上。文章提供完整代码示例和企业级实践案例，展示如何通过动态批处理、内存优化等技术在推荐系统中实现吞吐量3.2倍提升。同时给出系统化调试框架和故障排查指南，为开发者提供从入门到精通的优化全链路方案。]]></description><category></category></item><item><title><![CDATA[使用Python DSL定义与生成昇腾融合算子的艺术]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155858281</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155858281</guid><author>newBorn_1991</author><pubDate>Fri, 12 Dec 2025 16:05:57 +0800</pubDate><description><![CDATA[本文深入探讨基于Python DSL的昇腾融合算子开发新范式。面对AI模型复杂度的指数级增长，传统C++手写算子方式已无法满足开发效率需求。文章系统介绍TVM/MLIR编译技术CANN AKG自动代码生成动态Shape符号推导三大核心技术，通过完整的Python DSL实现案例展示如何将开发周期从周级缩短至小时级。实测数据显示，基于DSL的融合算子开发在保持95%+硬件利用率的同时，提升5-8倍开发效率，为大规模算子部署提供革命性解决方案。昇腾训练营简介。]]></description><category></category></item><item><title><![CDATA[Ascend C 未来展望：从显式并行到AI原生编程的演进之路]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155705888</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155705888</guid><author>newBorn_1991</author><pubDate>Mon, 08 Dec 2025 14:35:12 +0800</pubDate><description><![CDATA[摘要：本文系统探讨AscendC编程语言的演进路径，从显式并行向声明式编程、智能编译和自适应运行时发展。通过技术解析和案例验证，展示其如何从硬件专属语言转型为AI原生范式。关键创新包括AI驱动优化、软硬件协同设计和统一编程模型，实测开发效率提升5-10倍，硬件利用率保持85%以上。文章提供5个架构图、3个可运行代码示例及企业级优化指南，为开发者绘制完整技术路线图。特别指出智能编译和自适应运行时将大幅降低开发门槛，同时解决性能可移植性等核心挑战，推动AscendC向更智能的AI原生编程体验演进。]]></description><category></category></item><item><title><![CDATA[Pybind调用入门 - 为何它是连接C++算子与Python世界的桥梁？]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155646808</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155646808</guid><author>newBorn_1991</author><pubDate>Sat, 06 Dec 2025 20:26:40 +0800</pubDate><description><![CDATA[本文详细介绍了如何使用Pybind11将高性能C++算子封装为Python接口，实现性能与开发效率的平衡。主要内容包括：1. Pybind11的核心技术原理与架构设计，展示其轻量级但强大的特性；2. 类型系统和内存管理等核心机制的深度解析；3. 封装AscendC算子的完整实践指南，涵盖环境配置、代码实现、编译配置和测试验证；4. 企业级应用中的高级优化技巧和故障排查方法。通过实测数据表明，Pybind11封装的算子性能比纯Python实现提升10-100倍，同时保持Python的易用性。文章还展望了Pyb]]></description><category></category></item><item><title><![CDATA[构建高性能Ascend C Element-Wise算子 — 从核函数设计到深度优化]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155646692</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155646692</guid><author>newBorn_1991</author><pubDate>Sat, 06 Dec 2025 20:05:49 +0800</pubDate><description><![CDATA[摘要：本文系统介绍了基于昇腾AI处理器的Element-Wise算子开发与优化全流程。首先解析AscendC并行编程模型架构，包括核函数设计、内存层次结构与流水线并行技术。通过向量加法实例详细展示DoubleBuffer、向量化指令等关键优化方法，提供可部署的完整代码实现。性能测试显示，经过系统优化后算子性能提升可达4倍以上。文章还包含混合精度计算、动态Tiling策略等高级技巧，并给出常见问题解决方案与性能分析工具使用方法，为开发者提供从入门到精通的完整技术路径。]]></description><category></category></item><item><title><![CDATA[AsNumpy 在高校 AI 教学中的实践 - 开源赋能下一代AI人才]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155577760</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155577760</guid><author>newBorn_1991</author><pubDate>Fri, 05 Dec 2025 11:22:44 +0800</pubDate><description><![CDATA[本文介绍了哈工大团队基于昇腾CANN生态开发的AsNumpy工具，该工具通过NumPy语法直接驱动昇腾NPU，为AI教学带来革命性变革。文章分析了当前AI教育存在的三大痛点（理论实践脱节、硬件抽象缺失、生态割裂），并展示了AsNumpy如何通过保持NumPy接口兼容性、隐藏硬件复杂性，让学生无缝体验NPU加速效果。文中提供了线性代数计算、科学模拟等教学案例，对比显示NPU可获得10-100倍加速。此外，还详细介绍了实验室建设方案、课程设计框架和教学评估体系，指出AsNumpy构建了连接算法与硬件、课堂与产业]]></description><category></category></item><item><title><![CDATA[超越MoeGatingTopK - Ascend C在Transformer架构中的其他融合算子实践]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155577321</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155577321</guid><author>newBorn_1991</author><pubDate>Thu, 04 Dec 2025 18:54:28 +0800</pubDate><description><![CDATA[本文系统介绍了Transformer架构中关键融合算子的优化实践，涵盖FlashAttention、GroupedGEMM、LayerNorm等核心算子的AscendC实现。通过分块计算、向量化优化、动态调度等技术，实现了3-8倍的性能提升。文章详细分析了各算子的硬件适配方案、内存访问优化策略及企业级部署案例，并提供了性能调优检查清单和回归预防机制。实验数据显示，优化后的融合算子使整体模型性能提升5.2倍，计算单元利用率从45%提升至88%。该研究为大规模Transformer模型的高效部署提供了完整的算子]]></description><category></category></item><item><title><![CDATA[Ascend C算子开发入门：从AddCustom到Sigmoid的代码实现与思想升华]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155538450</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155538450</guid><author>newBorn_1991</author><pubDate>Wed, 03 Dec 2025 19:25:13 +0800</pubDate><description><![CDATA[本文深入解析AscendC算子开发流程，聚焦AddCustom和Sigmoid两个典型算子，从架构设计到代码实现。详细阐述了AscendC的异构计算理念、Kernel函数结构和Tiling策略，并提供了Sigmoid算子的完整实现代码与性能分析。文章特别强调了开发过程中的常见问题及解决方案，帮助开发者快速掌握AscendC算子开发的核心技术，为AI模型的高效实现奠定基础。通过系统化的讲解，使读者能够理解从简单加法到复杂激活函数的开发跨越，并掌握性能优化关键技巧。]]></description><category></category></item><item><title><![CDATA[Ascend C性能优化深度探秘：Double Buffer与AtomicAdd的实战应用]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155538398</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155538398</guid><author>newBorn_1991</author><pubDate>Wed, 03 Dec 2025 18:57:36 +0800</pubDate><description><![CDATA[本文基于13年AscendC优化经验，深入解析DoubleBuffer与AtomicAdd两大核心技术。DoubleBuffer通过计算与数据搬运重叠，可将计算单元利用率提升至80-90%；AtomicAdd则通过硬件级原子操作优化梯度累加等场景。文章提供完整实现代码，包括AscendC专用优化模板，并通过企业级案例展示3倍以上性能提升。性能测试显示：批量AtomicAdd提速1.6倍，向量化优化达2.21倍，结合分层归约策略最高实现3.51倍加速。同时提供高级调试工具和常见问题解决方案，为昇腾平台开发者提]]></description><category></category></item><item><title><![CDATA[Triton - Ascend算子性能优化实战：从架构原理到企业级优化]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155497139</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155497139</guid><author>newBorn_1991</author><pubDate>Tue, 02 Dec 2025 17:41:09 +0800</pubDate><description><![CDATA[本文深入解析Triton在昇腾AI处理器上的内存管理和并行计算优化技术。涵盖内存层次架构数据布局优化并行调度策略等核心内容，通过完整代码示例展示如何提升算子性能2-5倍。文章包含昇腾平台特有的UB缓存管理原子操作优化动态负载均衡等实战技巧，为AI开发者提供从入门到精通的完整解决方案。基于实际项目经验，分享独特优化见解，帮助读者掌握高性能算子开发的关键技能。本文系统解析了Triton在昇腾平台上的并行计算优化技术。通过分块计算动态负载均衡内存访问优化等核心策略，能显著提升算子性能。]]></description><category></category></item><item><title><![CDATA[性能瓶颈诊断与优化 - Triton-on-Ascend算子调试与性能分析实战]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155496687</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155496687</guid><author>newBorn_1991</author><pubDate>Tue, 02 Dec 2025 15:27:16 +0800</pubDate><description><![CDATA[本文系统介绍了Triton-on-Ascend算子性能优化方法论，涵盖从理论基础到企业级实践的完整流程。通过硬件性能特征分析、诊断工具链使用、典型瓶颈识别（如矩阵乘法案例）等环节，详细展示了&quot;测量-分析-优化-验证&quot;的优化闭环。文章提供内存访问优化、计算优化等实战技巧，并包含自动化报告生成和可视化方案。基于推荐系统等企业案例数据，验证优化方法可获得2.34倍的能效提升。最后总结了性能优化的黄金法则和检查清单，为开发者提供了一套可落地的优化体系。]]></description><category></category></item><item><title><![CDATA[Ascend C双页表技术详解 - 虚拟地址映射与NPU并行搬运优化]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155458165</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155458165</guid><author>newBorn_1991</author><pubDate>Mon, 01 Dec 2025 18:21:52 +0800</pubDate><description><![CDATA[本文深度解析AscendC双页表技术的原理与优化价值，重点探讨虚拟地址映射、多级页表管理和并行搬运优化等核心技术。通过分析NPU存储单元特性和矩阵分块优化方法，展示双页表技术如何实现内存访问并行化和搬运效率提升2-3倍。文章包含完整的代码实例和性能数据，详细介绍了双页表工作机制、并行地址转换优化、Matmul核函数实现等实战内容，并提供了针对不同工作负载的优化配置建议。性能分析显示，双页表技术可将传统单页表32%的地址转换开销降至4%，在顺序访问场景带宽提升2.8倍。最后总结了智能页表管理、异构页表和安全增]]></description><category></category></item><item><title><![CDATA[Ascend C实现Pow算子——Kernel核函数实现]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155457978</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155457978</guid><author>newBorn_1991</author><pubDate>Mon, 01 Dec 2025 18:17:29 +0800</pubDate><description><![CDATA[本文深入探讨了AscendC核函数实现技术，以Pow算子为例展示了从数学公式到硬件指令的完整转换流程。文章重点分析了向量化计算优化、多级内存管理、流水线并行等关键技术，提供了数值稳定性处理、边界条件应对等实战解决方案。通过分层架构设计、双缓冲技术和指令级优化，实现了计算性能9.11倍的提升，硬件利用率达95%。文中包含完整的代码实现和性能对比数据，为AI加速器开发提供了可复用的高性能算子开发模式，特别适用于推荐系统等需要大规模Embedding计算的场景。]]></description><category></category></item><item><title><![CDATA[Ascend C算子开发范式演进：从基础实现到高性能优化的工程哲学]]></title><link>https://blog.csdn.net/newBorn_1991/article/details/155392859</link><guid>https://blog.csdn.net/newBorn_1991/article/details/155392859</guid><author>newBorn_1991</author><pubDate>Sat, 29 Nov 2025 18:23:26 +0800</pubDate><description><![CDATA[《AscendC算子开发范式演进与实战》摘要 本文系统阐述了昇腾CANN训练营中AscendC算子开发的范式演进历程。从基础Kernel调试、生产级框架集成到高性能优化和自适应计算，构建了完整的开发方法论。关键技术包括：1）最小化验证的调试哲学；2）内存层次与向量化优化；3）动态Shape自适应架构；4）AI驱动的自动优化。通过电商推荐系统等企业案例，展示了3-5倍的性能提升效果。文章提供了性能检查清单和故障排查指南，为开发者勾勒出从功能实现到智能优化的进阶路径，揭示了算子开发从&quot;工匠&quot;]]></description><category></category></item></channel></rss>