- 博客(28)
- 收藏
- 关注
原创 如何通过多智能体协同实现 AI 软硬件评测的全流程自动化(附技能库DeepEval-Skills开源仓库)
为解决传统AI评测人工成本高昂、技术门槛高、跨芯片适配难等痛点问题,DeepLink团队推出多智能体协作的自动化评测方案,构建多智能体协作机制,实现AI软硬件评测的全流程自动化,能够显著提升评测效率。此外,团队在近日开源了 AI 全环节软硬件验证技能库(DeepEval-Skills),作为验证平台的核心工具之一,DeepEval-Skills已适配多款国内外主流AI芯片,覆盖 NLP、CV、多模态、科学计算、语音等10余个评测子场景,兼容主流智能体工具,支持开发者开箱即用,有效降低AI芯片评测门槛。
2026-06-26 19:56:01
394
原创 3DGS技术揭秘:重构3DGS管线以适配矩阵乘法计算单元
3D高斯泼溅(3DGS)凭借出色的渲染质量和速度,已成为三维重建、具身智能等领域的当红技术。然而,当场景规模扩大或分辨率升至4K时,即使3DGS也难以维持实时帧率。现有优化多从算法角度压缩高斯数量或简化光栅化,却忽略了更根本的问题:3DGS的渲染管线与硬件特性并不匹配。本文从硬件加速角度:将Alpha混合过程映射为矩阵乘法,让Tensor Core真正参与3DGS渲染,并设计G2L坐标变换解决FP16精度难题。基于这一思路将详细介绍如何针对GPU、NPU和树莓派的不同硬件架构与性能约束,开展专项适配与优化
2026-06-17 15:32:39
441
原创 DeepLink多元算力混合推理方案升级并开源,携手行业加速打造Token经济新形态
近日,上海人工智能实验室(上海AI实验室)升级并开源DeepLink多元算力混合推理技术方案,在此前仅支持多国产芯片的基础上,拓展NVIDIA 等芯片跨架构混合推理能力,满足多类推理场景需求。为便于方案落地,上海AI实验室联合八家国产芯片厂商推出标准化推理镜像,开发者下载即可快速部署;开源上述方案核心技术——智能流量路由系统DLRouter,助力行业低成本构建高吞吐、低时延的异构推理服务。
2026-06-10 15:21:49
368
原创 Triton第三课:Grouped GEMM 算子优化思路与实战技巧
本文提出了一种针对动态Grouped GEMM的优化方案,详细介绍了方案思路与优化技巧,并展示了我们的实测数据,优化与实测均以 Triton 实现。核心思路是将 group Meta data的读取与使用过程尽可能保留在 GPU 端完成, 该方案可以避免动态 grouped GEMM 中的 metadata readback synchronization,同时正确处理 group 边界和尾块。
2026-06-08 16:38:03
490
原创 Agent时代的存储(下): token账单爆炸?如何开源节流?
本文探讨了Agent时代存储优化的新思路。在上篇的基础上,下篇主要介绍运用超80万条文本片段进行的动态控制实验,基于Agent的局部性特征进行存储方案优化,成功提升了引用的效率,最终可以让模型容易进行引用而不是生成,从而让Agent执行任务变得更便宜。在本篇中详细介绍了在“紧凑布局”和“自适应索引”这两个优化方向上的探索与实验发现,并提出了在生产环境中的工程建议及未来优化方向!
2026-05-27 16:42:28
346
原创 Agent时代的存储(上):有了“Memory”还要“Harness”?Agent的痛点到底在哪?
文章聚焦【Agent时代的存储】分上下两篇展开,本篇中首先描述了Agent的成本和稳定问题,挖掘这个问题的根因,讲讲为什么会选择存储作为答案。紧接着介绍业界火热的答案,展开分析方案中的核心贡献和关键矛盾,复盘借鉴推荐系统中的工程共识与和优化思路,聊一聊数据格式、搜索方案、优化假设等工作如何嵌入到大模型时代的存储方案中。在下篇中将会用一个简单的假设关联现有的尝试,选取业界共识的技术,在Agent典型工作场景中做一些新的局部性优化实验。
2026-05-25 11:00:32
414
原创 如何让 Agent 安全地执行代码:Sandbox Runtime 原理解析
随着AI Agent从实验环境走向生产环境,Sandbox沙箱技术成为保障系统安全的核心基础设施。本文从“为什么需要”到“如何实现”再到“怎么选”:介绍 Agent Sandbox 的需求背景,在集群中如何提供规模化Sandbox 服务,最后探讨底层 Sandbox Runtime 技术路线并给出选型建议。
2026-05-18 11:10:50
532
原创 具身强化学习框架RLightning发布,一套代码实现从单机开发到规模化验证,加速物理智能算法迭代
作者:YZY, QJW, ZYC, LHJ from DeepLink Group @ Shanghai AI Lab。
2026-04-17 14:05:11
409
原创 上海AILab发布智能算子迁移系统,多款国产芯片在公开数据集转化通过率可超90%
KernelSwift 把 “大模型偶尔写出好算子” 的偶然事件,变成 “持续、可复现、高性能” 的必然结果。其通过可控的优化迭代框架、分层的反馈体系、多样化的探索策略,让大模型真正成为算子优化的 “智能助手”,结合DeepLink芯片适配的基础和技术能力,既降低了底层优化的技术门槛,又持续推高 AI 系统的性能上限。未来,随着数据飞轮的持续转动,KernelSwift 还将在更多算子场景、更多硬件架构下释放更大价值。
2026-04-14 10:34:08
414
原创 支持变长序列的Mamba-1训练
作者:FR、XHR、ZJC from HPC Group@ Shanghai AI Lab,WZR、CZ和SP from NDS Group@ Shanghai AI Lab。
2026-04-10 18:08:23
405
原创 Triton 入门教学第二课:实现LayerNorm算子的六种方式
硬件认知决定优化方向:H200架构中CTA切换开销极低,应优先保证单program逻辑简单,而非减少program数量。缓存意识是性能关键:通过分块循环+访问方向交替(正向/反向),提升L2缓存利用率。边界处理需精细化:分离尾块与非尾块处理,无mask操作可获得5%+的性能提升。自动调优是终极解法:当单一算法无法通吃所有场景时,运行时AutoTune机制以微小缓存开销换取全局最优性能。高性能计算的终极目标不是写出"最优雅"的代码,而是构建"最适应"的系统。
2026-03-20 16:35:50
379
原创 超越简单公平:大规模异构算力调度中的多目标权衡与系统优化
多维公平性建模:首次将多资源、完成时间、长期公平三大维度融合为统一目标函数,通过权重动态调整适配不同场景,解决传统方案 单一维度偏科问题;异构资源适配:引入资源效能系数,量化不同 GPU 的性能差异,使公平性评估更贴合实际异构集群环境;智能优化融合:结合改进 DRF、遗传算法、强化学习,形成静态分配 + 动态优化的分层架构,既保证初始分配的公平性,又能实时适配集群负载变化;
2026-03-11 12:03:36
407
原创 跨芯片统一优化,DLCompiler 与 DLBlas 驱动算子极致表现!
回顾过往技术实践过程,上海人工智能实验室(上海 AI 实验室)DeepLink 团队产出许多开源成果。2025 年 9 月,DeepLink 团队开源扩展的深度学习编译器,以及面向大模型训练与推理、异构硬件适配的高性能算库。开发者无需手动调优,即可获得接近硬件峰值的性能。面向架构,研究团队通过深度融合,在性能保持无损的同时,突破了跨代迁移难题。
2026-03-09 14:07:12
512
原创 从混训到混推,DeepLink筑牢多元算力赋能“人工智能+”基座
全球人工智能正加速向通用人工智能(AGI)演进,大模型对高效、稳定、低成本的算力需求持续攀升。如能解决多元芯片异构智算集群间算力调度难、利用率低、资源浪费等瓶颈,将为释放异构算力潜能,实现高效协同,为迈向AGI筑牢算力基座。继2025年以,实现跨千公里多智算中心长稳混训千亿参数大模型后,上海人工智能实验室将“战果”拓展至大模型推理环节,于近期推出了(以下简称“DeepLink混推方案”)实现了对。当前的国产算力推理方案仅能支持单一型号集群的算力调度,因而无法适配多元芯片异构场景。
2026-03-06 10:55:43
436
原创 智算中心异构能力评估指南已启动编制
近期,在上海市人工智能标准化技术委员会支持指导下,上海人工智能实验室DeepLink及标准团队联合上海仪电旗下上海智能算力科技有限公司国产适配中心牵头召开《智算中心异构能力评估指南》上海市地方标准编制启动会。
2026-02-11 14:32:00
307
原创 由Ring-Attention性能问题引发的计算通信overlap分析
简要来说,Ring-Attention利用了分块注意力机制,将QKV张量沿序列维度分割成多个块,并使每个GPU最初分配一个块,实现了上下文并行计算。对于每个查询块,通过遍历所有KV块来计算其对应的注意力输出。通信以环形方式进行组织,每个GPU同时发送和接收KV块,使得通信可以与计算重叠。我们可以将Ring-Attention视为分布式的FlashAttention。左图是传统的Ring-Attention,右图是具有负载均衡特性的Zigzag-Ring-Attention举个例子,如上图所示。
2026-02-09 18:02:39
895
原创 从“数据作坊”到“数据工厂”:Nimbus,面向具身合成数据管线的统一生产框架
Nimbus 精准直击具身仿真合成数据生产的“碎片化、低效率、不稳定”三大痛点,通过创新的四层模块化架构提供了系统级解决方案。其中,调度优化层实现统一的动态流水线并行调度与容错机制,阶段执行层定义合成管线全生命周期的标准化执行抽象,功能组件层完成多类管线组件的归一化封装,后端优化层则针对各类渲染器落地通用型性能优化。这种分层解耦的设计,让统一的调度与优化原语能够无缝适配异构数据生成管线,无需开发者重写底层场景逻辑。
2026-02-06 10:48:43
1089
原创 AI4S 量子技术揭秘:打破谷歌量子计算的能效壁垒
量子计算是基于量子力学原理发展形成的信息处理的概念和技术体系。量子计算最开始源自物理学家费曼的构想。由于复杂且高度纠缠的量子系统难以用经典计算机高效模拟,费曼提出利用一种可控的量子计算机去研究量子系统的可能性。近年来,随着量子计算硬件与应用算法的不断进步,量子计算被认为有机会在某些特定的应用上提供指数级别的计算加速;另外量子计算作为一种区别于经典计算的体系,因不再受到晶体管极限的限制,而受到人们的重视。在硬件方面,量子计算处理器目前主流路线包括超导、离子阱、光量子、中性原子等。
2026-02-04 17:50:38
936
原创 如何用 Triton实现一个更高效的topk_gating kernel?——算子合并技术
在本文中,我们通过观察topk_gating算子的内在结构,入手先后尝试了3种方法,Cuda Graph、torch.compile和Kernel fusion。经过比较验证后,我们得出第三种为最佳方式,尤其是在正向传播中性能提升了近20倍,从而实现了更高效的topk_gating kernel的目标。如果你喜欢我们的内容,欢迎我们!也欢迎在评论区与我们互动!你的支持是我们持续创作的动力!
2026-02-02 18:05:44
853
原创 多stream通信显存生命周期管理优化
CUDA 异步通信操作(如all_gather)是分布式训练中常见的操作之一,主要用于在多个 GPU 之间收集并同步数据。尽管这些操作本身是异步执行的,但在其执行过程中,GPU 显存会临时存储中间数据。这是因为在数据收集过程中,每个 GPU 不仅需要存储自己的数据,还需要存储从其他 GPU 接收到的数据,直到所有数据成功收集并整合完成。CUDA 采用动态内存管理机制,即内存的分配与释放是动态进行的。在异步操作(如all_gather)完成后,理论上占用的显存应当被释放。
2026-01-28 18:51:46
841
原创 取长补短,解锁推理性能1+1>2,DeepLink首发:生产级国产异构算力混合推理加速方案
DeepLink 团队打造首个国产异构算力 PD 分离混合推理方案,通过 PD 分离架构,实现了3款异构芯片的混合推理。此方案利用国产硬件的异构优势,实现 1+1 > 2 的推理效能,为 AI + 制造等场景的规模化落地提供可行路径。
2026-01-25 14:56:07
1069
原创 Agent Memory(下):工作记忆折叠、会话档案化与记忆演化
在本篇中,我们转向长期一致性与多轮任务保持这类任务。通过 DeepAgent、Claude Agent SDK 和 MUSE 三条路径,我们看到现代记忆系统正在从“存储”演变为“面向行为链的组织与演化”。真正的 Agent Memory 是一种系统工程,而非单一模块。它牵涉信息表达、结构化组织、检索策略、工具调用链管理、行为一致性维护以及跨会话的经验演化。如何让记忆不仅服务单一任务,还能在更大范围内形成可迁移的能力结构。基于信号质量、任务相关性和模型不确定性动态选择写入与遗忘。
2026-01-22 11:15:58
708
原创 Agent Memory(上):记忆的形态、功能与代表性路径
在本篇中,我们从宏观结构到具体机制,对 Agent Memory 的基础框架进行了系统化梳理。如何在有限上下文中维持有效的短期状态表示;如何在跨会话场景中构建可检索、可复用的长期知识链路。从这些方案中可以看到,Agent Memory 的关键不在于“存得更多”,而在于选择性保留、结构化组织、面向任务的可复用性。REFERENCE[1] [2](2025|NUS&人大&复旦&北大,Agent,LLM,RAG,上下文,记忆形式/功能/动态)AI Agent时代的记忆:综述[3]
2026-01-20 11:26:24
855
原创 “多元算力”推理生态的观察和思考
作者:JMX、TZY、ZSL、YFC from DeepLink Group @ Shanghai AI Lab。
2026-01-15 18:49:45
639
原创 国产芯片上如何排查大模型精度问题?干货经验分享!
我们使用了逐算子、逐 module 层精度对比工具,以及 loss 曲线比对的方式,排查分析了大模型微调时下游评测精度在 A2 和 CUDA 对不齐的问题。经分析发现和rms_norm存在精度问题,在使用非和使用组合的rms_norm后,loss 曲线可以和 CUDA 对齐,且下游评测任务的平均得分和 CUDA 基本一样。如果你喜欢我们的内容,欢迎我们!也欢迎在评论区与我们互动!你的支持是我们持续创作的动力!
2026-01-14 19:04:19
673
原创 LightRFT:轻量全模态微调RL框架,显存利用率飞跃!
"开源不仅是一种开发方式,更是一种先进的生产力协作模式"。联创团队将LightRFT开源,正是希望通过社区的力量,让RFT技术变得更普惠、更易用。目前项目已在GitHub开放全部源码,包含详细的中文文档、示例代码和问题解答等。如果你正在寻找一款靠谱的RFT框架,或者想参与开源项目积累经验,不妨试试LightRFT——star、fork、提issue,都是对开源项目最好的支持~ 也欢迎大家在评论区分享你的使用体验!
2026-01-12 13:59:14
1022
原创 RL 训练系统显存优化探究
本文针对强化学习训练中的显存瓶颈问题,提出了三种优化方案:1)通过循环计算方式优化logprob函数,将显存占用从4.6GB降至1.2GB;2)采用FlashAttention技术,进一步将显存占用降至96KB;3)使用liger_kernel优化基础算子,整体显存从67.2GB降至52.9GB。针对长序列大批次训练中logits占用过大问题(如16×10000批次占用45.3GB),提出fused_linear_logprob方案,通过重构计算逻辑避免保存logits,在保持计算速度的同时显著降低显存占用
2026-01-07 20:16:38
678
原创 DeepLink来了!邀你一起解锁 AI 开放计算新可能
DeepLink团队正式入驻,为大家带来AI 算力、软硬件适配等领域的前沿科技信息和相关讨论。欢迎大家关注并与我们多多讨论!
2026-01-06 12:09:06
682
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅