- 博客(1510)
- 资源 (3)
- 问答 (1)
- 收藏
- 关注
原创 Agent Scheduler:未来 AI 如何调度百万级智能体?
《AI Agent调度系统:从任务管理到资源分配的革命》摘要:随着AI Agent从单一问答转向复杂任务执行,传统任务调度方式面临挑战。本文探讨了Agent Scheduler作为AI时代"操作系统"的核心价值,重点分析了其在百万级Agent环境下的资源竞争、动态任务图处理、模型路由选择等关键技术难点。区别于Kubernetes等传统调度器,Agent Scheduler需要管理智能任务的完整生命周期,实现资源隔离和状态持久化,以应对AI任务的不确定性和长周期特性,最终构建支持海量智能体协同的高效分布式系统
2026-07-28 19:06:44
135
原创 Agent Memory 到底是什么?为什么长期记忆正在成为 AI 的第二大脑
《AI Agent记忆系统的演进与未来》摘要:随着AI从聊天机器人向智能体(Agent)演进,记忆系统(Memory)成为关键技术瓶颈。本文剖析了Agent记忆系统的核心设计:区分工作记忆(Context)与长期记忆(Memory),采用人类启发的三级分层架构(工作记忆/短期记忆/长期记忆),并揭示其存储内容远超聊天记录,涵盖用户画像、项目知识和行为经验。作者指出全量记忆注入Prompt的不可行性,提出知识网络(Memory Graph)比传统向量数据库更符合联想记忆特性。文章预见记忆系统将发展为包含存储、
2026-07-18 20:34:28
294
6
原创 AI 为什么越来越像微服务?
《从单体到微服务:Multi-Agent架构如何重塑AI系统》摘要:本文探讨了AI系统从单Agent向Multi-Agent架构的演进过程。作者指出,随着任务复杂度提升,单Agent系统面临Prompt膨胀、上下文爆炸、推理成本攀升等问题,这与早期单体软件架构的困境如出一辙。Multi-Agent架构通过专业分工(如Planner、Data、Report等独立Agent)显著降低系统复杂度,其设计理念与微服务架构高度一致:职责单一、独立扩展、降低耦合。文章详细分析了Agent间的三种协作模式(中心化调度/流
2026-07-18 20:12:46
328
6
原创 AI 为什么越来越依赖 Runtime?
摘要: 随着AI从ChatBot向Agent演进,Runtime(运行时环境)的重要性日益凸显。Runtime作为Agent的"神经系统",负责任务调度、上下文管理、工具编排、状态管理和推理调度等核心功能,决定了Agent的执行效率与稳定性。与传统ChatBot的单次推理不同,Agent需要管理复杂任务的生命周期,Runtime通过优化资源调度、减少模型调用次数,显著降低推理成本并提升任务成功率。未来,Runtime将逐步演变为AI时代的"操作系统",成为连接模型、工具和智能资源的中枢。开发者需重视Runt
2026-07-17 19:31:12
267
3
原创 一个 Agent,到底会消耗多少算力?
很多人认为,Agent 只是让大模型多了一双"手"。实际上,Agent 更像是让大模型拥有了一套完整的工作流程。相比传统 ChatBot,一次 Agent 任务可能包含几十次模型推理、多个工具调用以及持续增长的上下文。因此,一个 Agent 消耗的算力,往往远超一次普通对话。随着 Agent 应用越来越普及,真正决定 AI 成本的,也不再只是 GPU 的算力,而是整个执行链路的效率。
2026-07-17 19:24:49
1115
1
原创 Mac与Windows终端常用指令对比整理(实用避坑分享)
《Mac与Windows终端指令对照指南》由资深开发者展菲整理,针对双系统用户提供高频指令对照表。核心差异包括:Mac的ls对应Windows的dir,clear对应cls,ifconfig对应ipconfig。基础指令如cd、mkdir通用,但文件删除(Mac用rm -rf,Windows用rd /s/q)和进程管理(Mac用kill,Windows用taskkill)差异显著。文章特别提供Windows SSH公钥一键复制命令,并推荐开发者优先使用兼容Mac逻辑的PowerShell。该指南覆盖文件操作
2026-07-16 20:35:40
264
2
原创 AI 为什么越来越依赖带宽?一文讲透 Bandwidth 的底层逻辑
本文探讨了AI基础设施中带宽(Bandwidth)的重要性日益凸显的现象。随着GPU算力提升,大模型推理性能的瓶颈已从计算能力转向数据传输效率。文章分析了GPU"吃不饱"的原因:Transformer架构需要频繁访问模型参数和KV Cache,使AI推理成为内存和带宽密集型任务。作者指出,现代AI优化已进入"数据流时代",需要关注整个计算链路的数据传输能力,包括HBM、PCIe、NVLink等各个环节。多GPU系统尤其面临通信瓶颈,而HBM带宽比容量更为关键。未来AI竞争将从单纯的算力比拼转向数据流系统优化
2026-07-16 20:24:53
207
原创 为什么 AI 真正缺的不是算力,而是存力?
大模型时代的存储瓶颈:从算力驱动到存力驱动的范式转变 本文探讨了AI基础设施领域正在发生的重大转变:从算力优先(Compute First)转向存力优先(Memory First)。文章指出,随着大模型规模扩大,GPU计算能力提升速度已远超内存供给能力,导致GPU利用率低下而显存频繁爆满。作者详细剖析了AI Memory的复杂构成(包括HBM、KV Cache、激活值等),揭示了GPU因等待数据搬运而闲置的计算潜力,并分析了HBM带宽升级、KV Cache优化等技术趋势背后的存储墙(Memory Wall)
2026-07-15 16:21:15
429
原创 AI 算力到底是什么?一文讲透 Compute 的底层逻辑
AI算力发展的系统化趋势:从GPU到数据流动效率 随着AI技术的快速发展,业界对算力的理解正在发生根本性转变。展菲作为资深AI研发专家指出,当前AI领域存在一个重大误区:将GPU性能等同于AI算力。事实上,GPU仅是复杂计算系统中的一环,真正的AI性能瓶颈往往出现在数据流动环节。 研究表明,现代大模型运行时GPU的实际利用率通常仅有30%-60%,大量时间消耗在数据搬运、显存访问和网络同步等非计算环节。这种现象被称为"存储墙"问题,它揭示了AI算力的本质已从单纯的计算能力转变为数据流管理能力。 展菲强调,未
2026-07-15 16:00:01
215
原创 OpenClaw 实战:10 分钟接入高德地图 Skill(附完整配置教程)
文章摘要: 本文详细介绍了如何利用高德开放平台创建Web地图应用并完成技能调用的完整流程。首先指导用户注册账号、完成实名认证,创建应用并获取JS API Key。随后演示了网页端调用技能的具体步骤,包括下载Demo项目、配置密钥、浏览器运行和验证调用。接着重点讲解了使用OpenClaw工具完成技能调用的方法,涵盖环境配置、工具安装、初始化设置、网关管理以及通过可视化面板安装技能的完整过程。文章提供了大量截图和命令行操作指引,适合开发者快速掌握高德地图API集成和OpenClaw工具的使用技巧。
2026-07-14 16:49:20
285
原创 AI 为什么越来越懂代码?一文看懂 AI Coding 的真正进化
本文探讨了AI编程工具的演进趋势,从最初的代码补全发展到如今的软件工程智能体。作者展菲作为资深技术专家指出,AI编程的核心突破并非单纯依赖大模型,而是通过Context Engineering实现对项目上下文的全方位理解。现代AI编程工具(如Cursor、Claude Code)已能处理整个代码库、设计文档和开发历史,具备任务规划、多文件修改、自动化测试等能力。未来,AI将深入理解整个软件开发生命周期,从PRD到线上监控,最终进化为能够自主完成复杂开发任务的软件工程智能体。这一演变标志着AI从代码生成器向完
2026-07-14 15:46:57
248
原创 多智能体为什么越来越像微服务?
本文探讨了AI Agent系统从单体架构到多智能体的演进过程,指出其发展轨迹与微服务架构高度相似。作者展菲(AI领域专家)通过技术对比分析,揭示多智能体系统正在复现微服务的发展路径: 单体Agent因复杂度问题必然走向拆分,形成功能解耦的Agent网络 多智能体系统已出现与微服务相同的特征:单一职责、独立扩容、异步协作 规模扩大后产生典型治理需求,催生出Agent注册中心、事件总线等组件 调度系统设计逐步趋同于Kubernetes架构,面临相似的编排挑战 文章预判未来企业级Agent系统将形成类似K8s的运
2026-07-13 10:00:00
258
原创 MCP 到底是什么?一文讲透 AI 新标准
MCP协议:AI与工具生态的统一通信标准 随着大模型能力增强,AI在实际应用中面临工具连接碎片化问题。Anthropic提出的**MCP(Model Context Protocol)**旨在成为AI与外部工具的统一通信协议,类似HTTP之于互联网。MCP通过标准化工具发现、调用和管理,解决不同模型(如ChatGPT、Claude)需重复开发适配接口的痛点,实现“一次开发,多模型通用”。其架构分为三层:AI客户端、MCP Server(管理工具/资源/Prompt)和实际系统(如Git/数据库)。与单次调用
2026-07-08 11:40:19
5287
3
原创 Agent Runtime + 推理系统融合架构设计
本文探讨了AI Agent运行时与推理系统的融合设计。作者展菲指出,随着AI Agent功能的扩展,传统分离式架构(Agent Framework + 推理服务器)已显不足,存在重复计算、资源浪费等效率问题。文章提出构建统一的"AI Runtime"核心理念,通过整合Context中心、分层内存管理、共享KV缓存和统一调度器,实现Agent生命周期、上下文、工具调用与GPU资源的协同管理。这种融合架构可显著减少重复计算、降低延迟并提升资源利用率,为企业级AI应用提供更高效的运行时支持。作者强调,未来AI系统
2026-07-08 10:23:55
5257
1
原创 AI 推理成本下降的技术密码
摘要: AI推理成本持续下降的关键在于系统级优化,而非单纯模型简化。核心突破包括:1)MoE架构实现稀疏计算,降低参数量;2)KV Cache减少重复计算;3)FlashAttention优化GPU内存访问;4)Continuous Batching提升GPU利用率;5)PagedAttention管理显存碎片;6)量化技术压缩模型体积;7)Speculative Decoding加速生成。这些技术共同推动推理系统从模型计算向操作系统级Runtime演进,通过优化内存、调度和并行效率实现成本大幅降低。AI推
2026-07-05 20:20:44
8712
6
原创 从 KV Cache 到分布式状态机设计,一文讲透 AI Agent 的底层运行机制
Agent Runtime 是负责管理 Agent 生命周期、状态、记忆、工具调度和资源控制的运行时系统。AI AgentLLMRuntime完整 Agent状态ContextMemoryToolSchedulerCheckpointRecoveryGovernance真正运行的是 Runtime。模型只是 Runtime 中的一个组件。AgentLLMPromptLLMRuntimeMemorySchedulerLLM决定 AI 会不会思考。Runtime。
2026-07-05 20:01:44
8665
2
原创 KV Cache + Agent Runtime:为什么智能体系统会指数级吃显存?
摘要: Agent系统中KV Cache的指数级增长是导致GPU显存爆炸的核心原因。与普通ChatBot的线性KV Cache增长不同,Agent的多轮内部推理循环(如Tool Call、Memory Injection、Multi-Agent交互)会形成树状KV Cache结构,显存消耗随步骤、工具调用和记忆注入叠加而激增。解决方案包括分层管理KV Cache(热/温/冷缓存)、压缩记忆、限制推理轮次、隔离工具调用输出,以及共享前缀缓存等优化策略。Agent的高成本本质源于其“状态爆炸”特性,需针对性设计
2026-07-03 18:41:01
8627
2
原创 KV Cache 到底有多烧显存?一文看懂 AI 推理最大的成本黑洞
《Transformer推理显存黑洞:KV Cache的技术内幕与优化全景》 摘要:KV Cache是Transformer推理过程中鲜为人知却至关重要的显存消耗源。作为自回归生成的历史状态存储器,它逐层缓存Key/Value张量,导致显存占用随token数和用户数线性增长(如70B模型单用户可达4-8GB)。本文揭示了KV Cache导致GPU低利用率的核心矛盾,剖析了vLLM的PagedAttention分页机制、Prefix Cache复用等优化方案,并指出其本质是系统架构问题而非单纯计算优化。生产环
2026-07-03 18:28:04
8708
原创 Agent Memory:长期记忆实现原理,一文讲透 AI 为什么能够“越用越聪明“
本文深入探讨了AI Agent长期记忆系统的实现原理与架构设计。作者展菲(技术博主/图书作者)指出,真正的Agent记忆系统远非简单的聊天记录存储,而是一套包含工作记忆、会话记忆、情景记忆、语义记忆和程序性记忆的多层次架构。文章从LLM天然无记忆的特性出发,系统分析了五层记忆结构的功能差异:工作记忆处理即时任务,会话记忆维持对话上下文,情景记忆记录历史事件,语义记忆存储稳定知识,程序性记忆沉淀可复用技能。重点揭示了记忆管理器的核心作用,包括记忆分类存储、混合检索策略(结合关键词、向量和图检索)以及记忆压缩优
2026-07-02 18:54:16
8821
3
原创 AI Agent 如何实现自主决策?AI Agent 如何实现自主决策?一文讲透 Decision Engine 核心架构
本文深入剖析了AI Agent的决策机制,指出其核心在于持续运行的Decision Engine(决策引擎),而非单纯的LLM推理能力。作者展菲作为人工智能领域的专家,通过六层架构解析了企业级Agent的决策流程: 目标层(Goal):明确任务优先级和完成标准 上下文构建层(Context Builder):综合分析用户状态、环境等多元信息 推理引擎层(Reasoning Engine):生成多个候选方案 策略评估层(Policy Evaluator):进行风险、成本等合规性审查 动作选择层(Action
2026-07-02 16:19:20
8571
1
原创 HarmonyOS Agent Runtime 解析:AI 应用如何真正落地?
摘要: 本文探讨了HarmonyOS应用中AI Agent落地的核心挑战——Runtime(运行时环境)的重要性。作者展菲指出,许多团队过度关注Prompt、模型和RAG技术,却忽略了决定Agent能否稳定运行的Runtime层。真正的Runtime需承担九大职责:生命周期管理、任务调度、上下文管理、Agent调度、Tool运行时、记忆中心、事件驱动及系统治理,其架构类似Android ART或JVM,是AI系统的“大脑中枢”。企业级应用中,多Agent协同、任务树调度、动态上下文构建等场景需依赖Runti
2026-07-01 20:43:15
8665
原创 AI Runtime Kernel:鸿蒙 App 如何设计智能体内核?
文章摘要 展菲作为资深AI开发者提出,当前AI Agent发展的核心已从模型能力转向AI Runtime Kernel——类比操作系统的内核,它成为AI原生应用稳定运行的关键。文章系统阐述了Runtime Kernel的八大核心模块:生命周期管理、任务调度、上下文引擎、记忆中心、工具运行时、Agent总线、状态管理和安全治理,揭示了其作为"中央控制系统"如何统筹Agent的完整工作流(如任务分解、资源分配、失败恢复等)。通过对比Linux调度器机制,作者指出企业级AI应用的核心挑战已转变为复杂任务的组织与管
2026-07-01 19:25:37
8648
原创 机器人升级落地测评:我用屏幕端验证魔珐星云 SDK 的具身交互能力
本文介绍了魔珐星云SDK在数字人交互领域的创新方案,重点分析了现有数字人技术面临的三大痛点:延迟问题(3-4秒响应)、打断机制缺失和各模块割裂。文章通过对比传统视频流传输与星云的参数流架构,揭示了后者如何将端到端延迟压缩至500ms,实现实时交互。方案采用端侧渲染技术,通过传输驱动参数而非视频帧,节省80%带宽成本,支持低延时、高并发场景。作者以企业展厅为例,展示了参数流架构如何实现实时打断、表情同步等自然交互效果。最后简要提及了开发接入流程,包括应用创建、数字人配置等步骤。该方案为大模型在服务终端的落地提
2026-06-30 16:38:52
12284
5
原创 鸿蒙 App 如何设计 Agent Bus?一文讲透智能体通信机制
Agent Bus 是 Multi-Agent 系统从“函数调用架构”进化到“分布式智能系统”的关键基础设施。智能体协作方式的范式升级没有 Agent Bus 的 Multi-Agent,只是多个 Agent 的集合;有 Agent Bus 的 Multi-Agent,才是一个真正的“智能系统”。
2026-06-30 12:05:57
12191
3
原创 鸿蒙 App 如何设计 Tool Calling?一文讲透 MCP 与工具调用架构
本文探讨了大模型技术在鸿蒙应用开发中的关键问题——Tool Calling(工具调用)机制。作者展菲作为资深技术专家,从企业级系统架构视角剖析了如何让大模型从"会思考"到"会执行"的技术实现路径。 核心观点包括: Tool Calling是大模型与外部系统间的协议层,通过结构化指令实现任务执行 鸿蒙系统需设计专用Tool Runtime中间层,解决权限控制、安全审计等问题 提出六层企业级架构(LLM→Dispatcher→Registry→Permission→MCP→系统服务) 强调权限控制是核心安全机制
2026-06-30 11:55:57
12903
1
原创 HarmonyOS 游戏架构升级:从 Store 到 Runtime
本文探讨了HarmonyOS游戏开发中架构设计的演进过程。作者展菲(企业级AI项目研发管理者、技术图书作者)指出,开发者通常会经历三个阶段:从依赖ArkUI组件,到转向状态管理(Store),最终升级为运行时(Runtime)架构。文章通过对比分析,阐释了Store模式的局限性——它虽能管理状态,却无法处理游戏逻辑的复杂性,容易演变为"上帝对象"。 随着游戏系统(Physics、AI、Animation等)增多,Runtime层成为必要架构,它作为核心调度器统一管理系统执行顺序和频率,形成"Runtime→
2026-06-29 15:30:38
2050
19
原创 鸿蒙游戏 System Runtime:AI 时代的新引擎内核
本文探讨了HarmonyOS游戏开发中引入Runtime系统的重要性。作者展菲指出,许多开发者在Demo阶段仅使用简单状态更新,但随着项目复杂度提升,缺乏统一调度机制会导致System执行顺序混乱、状态竞争等问题。 文章提出现代游戏必须构建Runtime内核,其核心在于任务调度(Scheduler)而非简单循环。Runtime需要管理: System执行顺序(如Input→AI→Physics→Animation→Render) 完整的生命周期(onInit/update/onDestroy等) 不同频率的
2026-06-29 13:58:34
13276
原创 Agent Runtime:HarmonyOS PC 最值得关注的新架构
过去四十年,操作系统始终围绕Process和Thread构建 Runtime。而 AI Native 软件第一次让成为了新的运行对象。这意味着,传统的 Resource Runtime 已经无法独立支撑下一代软件。因此,HarmonyOS PC 最值得关注的新架构,并不是某一个 AI 助手,也不是接入某个大模型,而是一套能够长期管理目标、规划任务、组织上下文、调度工具并持续执行的。│││其中,Agent Runtime 不会替代操作系统内核,而是在其之上建立一层全新的。
2026-06-29 13:42:01
13246
原创 HarmonyOS PC 为什么需要无状态组件(Stateless Component)?
文章摘要 本文探讨了AI Native时代下UI框架状态管理的范式转变。传统组件(Component)与状态(State)绑定的设计在AI持续运行场景中面临挑战:当任务跨页面、跨设备执行时,组件销毁会导致状态丢失。作者提出状态应归属于运行时(Runtime),而非组件,并通过HarmonyOS案例说明无状态组件如何更好地配合Goal/Task/Context等长期运行实体。未来架构可能形成"Runtime驱动"模式,由Goal Graph、State Runtime等维护核心状态,组件仅作为观察者渲染数据,
2026-06-29 13:32:51
13917
1
原创 Task Graph:HarmonyOS PC 为什么重新定义任务调度?
Thread 如何运行?Task 如何完成?因此,未来的 Runtime 不会只维护 Thread Queue,而会维护一张持续演化的Task Graph。Scheduler调度 Thread。Scheduler调度 Task。从到,看似只是调度对象发生了变化,实际上意味着操作系统开始从资源调度(Resource Scheduling)迈向目标调度(Goal Scheduling)。而这,也正是 HarmonyOS PC 在 AI Native 时代重新定义任务运行模型的重要一步。
2026-06-28 18:04:08
13092
3
原创 Goal Graph:HarmonyOS PC 为什么要重写整个任务运行模型?
摘要: 展菲是一位专注于人工智能和前沿技术分享的资深开发者,在移动端、鸿蒙开发、物联网等领域有深厚造诣。他指出,随着大模型和Agent技术的兴起,传统以进程(Process)为核心的操作系统模型正在被以目标(Goal)为中心的运行模式取代。在AI Native时代,用户更关注任务目标而非具体应用,导致操作系统需要管理复杂的Goal Graph(目标图谱),而非简单的进程和线程。HarmonyOS PC通过构建基于事件驱动的Goal Graph模型,将任务、上下文、工具等动态关联,成为新一代AI运行时(Run
2026-06-28 16:13:18
13175
原创 Context Cache:HarmonyOS PC 下一代上下文系统揭秘
摘要: 本文探讨了AI应用中**Context Cache(上下文缓存)**的关键作用。传统AI系统每次请求都需重新构建完整上下文,导致响应慢、Token消耗高。作者指出,应缓存运行时上下文(如当前任务、工作区状态等),而非仅Prompt文本,以实现增量更新而非全量重建。Context Cache作为AI运行时的“工作记忆”,能显著提升推理效率与准确性。HarmonyOS PC凭借对工作区、任务等状态的实时维护,成为实现Context Cache的理想平台,可优化AI助手的响应速度与决策质量,避免重复计算带
2026-06-28 15:41:20
13023
原创 HarmonyOS PC 正在诞生新的 Scheduler:Agent 如何接管系统
摘要: 随着AI技术的演进,传统操作系统以线程(Thread)为核心的调度器(Scheduler)已难以满足AI原生应用的需求。未来软件将围绕目标(Goal)、任务(Task)和工具(Tool)等更高层对象进行调度,形成Agent Scheduler。HarmonyOS PC有望成为首个实现这一变革的平台,其调度系统将包含目标队列(Goal Queue)、任务拆解器(Planner)、任务调度器(Task Scheduler)、工具调度中心(Tool Dispatcher)和执行监控(Execution M
2026-06-28 15:21:14
13051
原创 Context Engine:HarmonyOS PC 最容易被低估的一层
本文探讨了AI应用开发中常被忽视的关键要素——Context(上下文)的重要性。作者展菲指出,当前AI应用开发过度关注模型参数、推理能力等指标,而忽视了Context Engine的核心作用。文章通过七个方面分析:1)Context将成为AI Runtime的核心管理对象;2)聊天记录不等同于运行时上下文;3)Context Engine实质是运行时状态数据库;4)Context比Memory更能反映当前状态;5)Context应属于Runtime而非聊天会话;6)HarmonyOS PC的Workspac
2026-06-26 11:36:00
4061
36
原创 从 RNN 到 GPT:大模型架构演化史
如果回顾过去十几年的发展,会发现每一次架构升级,其实都是为了突破一个工程瓶颈。传统神经网络│▼RNN(解决上下文)│▼LSTM(解决长期依赖)│▼Transformer(解决并行计算)│▼GPT(解决规模扩展)│▼MoE(解决推理成本)│▼Agent(解决任务执行)换句话说,AI 架构的发展从来不是简单的技术迭代,而是一场围绕记忆、计算、扩展、成本和执行能力展开的持续演进。谁的模型更大。谁的智能系统效率更高。因为对于下一代 AI 来说,
2026-06-26 11:05:26
310
4
原创 鸿蒙 App 如何实现 Multi-Agent 协同?一文讲透智能体团队架构设计
很多人以为:Multi-Agent = 多个 Agent。实际上:Multi-Agent = 一套面向复杂任务的分布式智能体系统。SupervisorAgent BusTask DAGRuntime未来 AI Native 鸿蒙应用的竞争,拼的也不再是谁接入了大模型。而是谁拥有更强的:Agent Runtime 与智能体协同能力。
2026-06-25 19:41:31
15279
4
原创 鸿蒙 App 如何设计 Memory Center?一文讲透 Agent 的长期记忆架构
AI Agent记忆中心架构解析 本文系统阐述了AI Agent中Memory Center的核心价值与设计方法。作者指出传统无状态系统无法满足AI Agent持续服务需求,提出四层记忆架构: 工作记忆(Working Memory)- 短期任务状态缓存 情景记忆(Episodic Memory)- 时间序列事件记录 语义记忆(Semantic Memory)- 用户画像向量存储 技能记忆(Procedural Memory)- 可复用工作流库 文章强调结构化记忆管理优于原始对话存储,建议采用向量数据库实现
2026-06-25 15:03:51
1155
55
原创 为什么 GPU 利用率只有30%?揭秘大模型推理系统的真实瓶颈
大模型推理中GPU利用率低的系统瓶颈分析 本文从系统架构角度深入分析了大模型推理中GPU利用率低的本质原因。主要内容包括: GPU利用率的真实含义:反映SM忙碌程度而非工作时间占比 训练与推理的本质差异:推理面临小Batch、动态请求导致计算不连续 Decode阶段的瓶颈:Token逐个生成形成超小矩阵,GPU"吃不饱" Memory带宽限制:权重和KV Cache读取时间常超过计算时间 KV Cache的资源吞噬:大规模并发下显存管理成为主要挑战 Continuous Batching的价值:合并请求形成
2026-06-25 14:44:23
260
原创 鸿蒙 App 如何设计 Agent Runtime?一文讲透 AI Native Runtime 架构
展菲是资深人工智能研发专家,专注移动端与物联网开发,著有多本技术书籍。他在技术博客中深入分析了AI Native时代App架构的变革趋势,指出传统MVVM模式已无法满足AI Agent驱动的交互需求。文章系统阐述了Agent Runtime的七层架构(Intent/Planner/Scheduler/Memory/Tool/State/UI),强调其作为系统级运行时的核心价值——通过任务编排、记忆管理、工具调度等能力,实现从"事件驱动"到"目标驱动"的范式转换。这种新型运行时将成为AI原生应用的基础设施,如
2026-06-24 10:59:56
2057
33
原创 为什么 MoE 成为大模型降本增效的关键?
文章摘要:MoE——大模型降本增效的关键架构 本文深入分析了混合专家系统(MoE)如何解决大模型成本爆炸问题。传统密集模型(Dense Model)存在计算资源浪费的缺陷,所有参数必须全量参与计算。MoE通过引入路由器(Router)机制实现智能分流,每次推理仅激活少量专家模块(如总参数671B仅激活37B),在保持模型能力的同时大幅降低计算成本。文章详细阐述了MoE在训练成本优化、推理效率提升方面的优势,特别指出其天然适配Agent时代的特性。尽管存在跨节点通信等挑战,MoE仍代表了大模型发展的未来方向,
2026-06-24 10:14:13
211
3
FBYBankCardRecognition-iOS-master.zip
2020-05-28
FBYFaceRecognitionDemo_iOS-master.zip
2020-04-28
LeetCode - #3 最长未重复子字符串
2021-11-16
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅