自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(88)
  • 收藏
  • 关注

原创 多开几个 Agent,为什么反而更难把活干好?---- 从 Claude Code、Codex 到 DeepSeek Harness,拆解多 Agent 的收益、成本与运行机制。

Multi-agent 描述多个 Agent 参与的系统,Team 的含义取决于具体实现。本文从 Claude Code 的 Subagent 与 Agent Teams 出发,结合 Codex、OpenCode、pi 和 DeepSeek Harness,比较任务分解、通信与运行时机制,并引入 2026 年的工程实验及 9 月的研究,说明何时值得拆分、如何验证收益,以及哪些历史数据不能直接外推。

2026-09-16 11:12:23 349

原创 模型能力是公共品,使用模型的能力才是护城河

身边总有人说 AI 解决不了这个、解决不了那个。可 AI 已经拿了 IMO 金牌,一个夏天解开了十几道悬置几十年的数学难题。问题来了:同一个模型交到我们手里,能做到吗?大概率不能。本文用一篇论文里的对照实验说明——模型一字未改,只是换了一套「生成—验证—修正」的用法,成绩就从铜牌线以下跳到金牌水平。文中拆解这套用法背后的三层能力:会问、会搭、会判,也说明什么时候真是模型不行。结论:模型能力是公共品,使用模型的能力才是拉开差距的地方。

2026-09-13 17:04:09 211

原创 GPT-6 Astra 深度解析:普通用户何时能用,以及开发者真正需要关注什么

本文系统介绍 OpenAI GPT-6 Astra 的开放时间、核心规格、工具能力、API 价格及接入方式,并对比 GPT-5.6 系列的定位与成本。文章还说明异步工具调用、中途纠偏、推理强度调整、迁移注意事项,以及付费 ChatGPT 用户在尚未获得 Astra 权限期间每天可累积 1 次额度重置的补偿规则,适合普通用户和开发者快速了解这次更新。

2026-09-04 10:10:53 906

原创 MCP Apps 能直接返回 HTML,为什么还需要 A2UI?

同样是让 Agent 画界面,MCP Apps 返回服务端预写的 HTML、在沙箱 iframe 中渲染,样式主权归 Server;A2UI 返回 LLM 现场生成的声明式组件 JSON,由宿主用自己的组件库渲染,样式主权归 Host。真正的分水岭不是 HTML 还是 JSON,而是模板与生成。本文对照 MCP、MCP Apps、A2A、A2UI 规范原文,拆解机制、六个分水岭、三种共存形态与四种 HITL 机制,附决策树和避坑清单。

2026-09-02 15:13:35 193

原创 Agent 为什么不再只是聊天框:从 ChatGPT Work 与 Lovable 看运行时、MCP 和权限边界

聊天框只是入口,不是 Agent 的完整产品形态。决定 Agent 能否完成工作的是运行时:文件、浏览器、工具、状态、权限与执行记录。本文以 ChatGPT Work 的 Cloud/Local 信任边界和 Lovable 的 MCP 双接口为案例,拆解 Agent 产品的通用架构,并给出一份面向工程落地的检查清单。案例只是切口,主体是架构方法。

2026-08-31 12:03:59 347

原创 深拆 OpenAI GPT-5.6 效率工程:Agent 的账要按完整循环算,Harness 四板斧首次成文

解读 OpenAI GPT-5.6 效率博文:Codex/ChatGPT Work 共用的 Rust Harness 首次成文——工具按需发现、输出默认限幅 1 万 token、历史只追加、工具顺序确定化,四条纪律全部服务于 prompt cache 前缀命中,把循环开销从平方降回线性。另一半故事是 Sol 自主重写 GPU kernel、优化自己的投机解码与 serving 配置,端到端成本降 20%。核心判断:Agent 成本要按完整循环记账,Harness 已是与模型、推理引擎并列的第三个优化层。

2026-07-31 12:18:07 203

原创 翁荔闪电重返 OpenAI 执掌 RSI:AI「自我进化」,为什么先从 Harness 下手?

翁荔(Lilian Weng)因健康原因官宣离开Thinking Machines;不到48小时,OpenAI确认她回归并领导RSI(递归自我改进)研究。本文以此为引,结合她7月4日综述约35篇论文的博客《Harness Engineering for Self-Improvement》,梳理RSI概念源流,讲解Harness(模型的执行支架)的定义、三大设计模式与从提示词到优化器代码的优化阶梯,拆解七个未解瓶颈,并给出对开发者的三点观察:人事即路线、Harness工程离你不远、接口不死。

2026-07-30 10:23:41 241

原创 深拆 MCP 2026-07-28:握手与 Session 一起退场,状态去哪了

MCP 发布以来最大改版:SEP-2575 删除 initialize 握手,协议版本与能力改为每请求自描述;SEP-2567 删除 Mcp-Session-Id,跨调用状态上移为服务端铸造、模型携带的显式 handle;Roots/Sampling/Logging 进入 12 个月弃用期。红利是普通轮询 LB、HTTP 缓存与 OTel 链路即插即用;代价是新旧实现只能靠显式版本协商回退,没有透明兼容。官方抽样 1000 个开源 Server,90% 零迁移。

2026-07-29 11:22:10 204

原创 深拆 response_format:LLM 结构化输出凭什么“格式必对“,又为什么“内容不保证“

摘要 本文探讨了大语言模型中结构化输出(Structured Output)的实现机制,聚焦于strict: true模式的工作原理。研究发现: 主流服务商对response_format的实现分为三档:自由文本、JSON模式(仅保证合法JSON)和严格结构化输出(符合指定schema)。不同厂商在能力支持上差异显著。 strict: true的核心机制是约束解码(constrained decoding),通过将非法token的概率置为-∞实现生成时的强制合规,而非生成后校验。这种方法能100%保证输出格

2026-07-23 19:59:40 199

原创 万字长文详解 Agent 的评测机制:从任务、环境、轨迹到验证器、统计与持续回归

Agent 评测不是给最终回答打一个分,而是验证一个带状态、会调用工具、能修改外部环境、可能委派子任务且具有随机性的执行系统。完整评测对象至少包含任务、初始状态、Agent 配置、执行环境、资源预算、轨迹、终态、验证器和统计方法。本文从评测难点出发,结合 Open Managed Agents、DeerFlow、LangGraph、AgentScope、OpenCode、Codex 与 Pi 的开源实现,给出一套可落地的评测架构、数据契约、时序、指标、评分器设计、发布门禁和演进方法。

2026-07-21 22:04:10 559

原创 Agent 崩溃恢复机制:从 Checkpoint 到副作用一致性

Agent 可以连续工作数十分钟甚至数小时,也可能同时调用模型、Shell、浏览器、数据库、消息系统和多个子 Agent。一旦进程在中途退出,问题便不再是传统意义上的「重新启动服务」:对话也许已经保存,文件也许已经修改,邮件也许已经发出,但系统并不知道最后一步究竟完成到了哪里。这正是 Agent 崩溃恢复最难的地方。它同时涉及分布式系统、工作流引擎、事件日志、任务调度、外部副作用、沙箱生命周期和人机协作。单独增加一张 checkpoint 表,或者提供一个 命令,都不足以解决完整问题。本文从故障语义出发,

2026-07-21 19:44:11 224

原创 23 道经典面试智力题与解析

编码信息:毒酒测试、电线对应关系。构造对称:圆桌硬币游戏、平分空心蛋糕。维护不变量:巧克力分块、真假处理器、赛马筛选。逆向排除:聚会握手、孩子年龄、错误标签。位运算技巧:统计置位数、判断 2 的幂。原地变换:反转单词顺序、循环移动字符串。解决这类问题时,关键不是枚举更多情况,而是先确认「一次操作最多提供多少信息」「哪些状态在操作后保持不变」以及「哪些候选可以被确定性排除」。

2026-07-21 15:09:00 234

原创 从 Loop 到 Graph:生产级多 Agent 系统为什么要同时运行两张图

文章摘要: AI代理系统正从Loop Engineering迈向Graph Engineering新阶段。Graph Engineering通过可编程图结构组织多代理协作,将职责、依赖、状态等要素从对话记录中提取为可执行系统。其核心包含两张图:Org Graph定义长期角色与权限,Work Graph管理动态任务流。与传统工作流不同,Agent任务图需支持运行时动态调整(如拆分/取消/重路由节点)。这标志着控制流从隐含的模型上下文转向显式、可观察的系统结构,使复杂任务的并行处理与故障恢复成为可能。

2026-07-21 11:30:54 389

原创 AG-UI 协议详解:Agent 与用户之间缺失的那一层

AG-UI协议:解决Agent与用户交互的标准化方案 摘要:AG-UI(Agent–User Interaction Protocol)是针对Agent与用户界面交互的开放协议,由CopilotKit团队发起。它通过标准化、类型化的事件流,规范Agent后端与用户界面间的双向实时通信,解决Agent"最后一公里"的交互问题。AG-UI协议采用客户端-服务器架构,定义16种标准事件覆盖Agent生命周期中的关键交互场景,包括生命周期、文本消息、工具调用、状态管理等。

2026-07-14 20:40:43 380

原创 会写代码的 AI 很多,能算 Coding Agent 的没几个

会写代码 ≠ Coding Agent。分水岭只有一条:"编辑—执行—验证"闭环是否长在 agent 自己身上。附五件套清单、零装配测试,及 LangChain、AgentScope 逐个裁决。

2026-07-13 15:55:29 161

原创 Loop Engineering:你不再 prompt agent,而是设计 prompt agent 的系统

Loop Engineering:下一代AI代理开发范式 文章指出,当前AI代理开发正从手动Prompt Engineering转向Loop Engineering新范式。核心论点是:Harness并未过时,Loop Engineering是在其基础上增加自主控制系统层,而非替代。 关键要点: 三层技术栈:Prompt Engineering(单条指令优化)、Context Engineering(上下文管理)、Loop Engineering(自主控制系统设计)相互叠加而非取代

2026-06-10 09:55:03 459

原创 预训练 vs 后训练:用“培养一个员工“讲清大模型是怎么炼成的

本文用"培养员工"的比喻,通俗易懂地拆解了大模型训练的两个核心阶段: 预训练(通识教育):通过海量文本的"完形填空"任务,让模型学习语言规律和世界知识,形成知识渊博但不会对话的"基座模型"。这个阶段消耗巨大算力,决定模型的能力上限。 后训练(岗前培训):包括两个关键步骤: SFT(监督微调):教会模型如何回答问题而非简单续写 RLHF(强化学习对齐):通过人类反馈优化回答质量,使输出更符合人类价值观 这种分工设计实现了知识学习与行为规范的解耦,既保证了核心能力的通用性,又使模型行为可调可控。

2026-06-08 10:57:39 261

原创 Agent 沙盒的对比和分析

从产品形态、隔离模型、状态持久化、浏览器能力、可观测性与开源生态几个维度,对“Agent 沙盒”做一份偏选型导向的全景梳理。

2026-04-07 11:45:27 814

原创 Claude Code 权限系统拆解:一个工具调用要过几道关卡才能执行?

Claude Code 的权限系统采用多层决策流水线设计,包含规则引擎、工具自检、安全检查、AI分类器等6个阶段。核心特点是: 权限判定分内外两层,内层处理主干裁决,外层处理模式化后处理 提供7种内部权限模式,但仅公开5种 执行流程严格有序:从Deny/Ask规则检查开始,到工具自检、安全检查,最后根据模式处理 危险模式并非完全跳过检查,关键安全闸门仍然有效 支持工具自定义权限检查,默认允许但可重写实现细粒度控制

2026-03-31 23:59:03 399

原创 Claude Code 的三种多 Agent 模式:Coordinator、Swarm 和 Fork

Claude Code系统实现了三种不同的多Agent协作模式,针对不同任务场景提供了灵活解决方案: Coordinator模式:中心化调度架构,协调者负责任务分解与结果综合,多个Worker并行执行子任务,通过XML格式进行异步通信。适合复杂工程任务的多阶段流水线处理。 Swarm模式:弱中心化团队协作,通过Team Lead管理生命周期,团队成员可互发消息。提供最接近真实团队协作的体验,支持长期运行的并行任务。 Fork模式:轻量级子进程机制,子Agent完整继承父进程上下文和工具集,支持快速并行探索。

2026-03-31 23:57:51 2193 4

原创 Claude Code 的三层记忆系统:从“一次性对话“到“有记性的搭档“

Claude Code采用三层记忆架构解决不同时间尺度的记忆问题: 短期记忆(Session Memory):当前会话内的结构化笔记,由后台代理维护10个固定模块的Markdown文件,在token增长或工具调用达到阈值时触发更新。 中期记忆(Auto Memory Extraction):每轮对话结束后自动提取关键信息存入磁盘,形成跨会话的持久记忆,下次会话会加载这些记忆文件。 长期记忆(Auto Dream):跨5次以上会话后自动整合修剪记忆目录,保持记忆的时效性和相关性。

2026-03-31 23:56:43 1178

原创 拆解 Claude Code BashTool 的安全链路:让 AI 执行 Shell 命令,到底怎么防住它搞事

摘要:Claude Code 的 Bash 安全体系采用多阶段防护链设计,核心思路是"先确保正确解析命令,再进行权限判断"。其主入口是基于 tree-sitter 的 AST 解析,遵循 fail-closed 原则:对无法可靠解析的命令直接要求人工确认。系统还包含语义校验、权限规则、条件沙箱等多层防护,并保留传统路径作为补充校验。关键创新在于解决"安全检查器和真实 shell 对命令理解不一致"这一根本问题,而非简单依赖危险命令黑名单。

2026-03-31 23:55:08 635

原创 Claude Code 的上下文压缩流水线:一个 200K 窗口是怎么被精打细算的

本文解析了Claude Code的上下文压缩设计,采用分层递进的五级流水线策略。第一层(Tool Result Budget)优先将大工具结果持久化到磁盘;第二层(Snip Compact)截断历史消息;第三层(Microcompact)清除旧工具结果;第四层(Context Collapse)折叠提交日志;第五层(AutoCompact)才使用LLM摘要。这种设计从低成本操作逐步过渡到高成本摘要,在释放token和保护prompt缓存间取得平衡,有效解决了长对话中旧内容占用过多token的问题。

2026-03-31 23:53:54 1086

原创 Claude Code 源码泄漏:拆解一个工业级 AI Coding Agent 到底是怎么造出来的

Claude Code 架构解析 Claude Code 是一个完整的终端 Agent 操作系统,采用 TypeScript + React (Ink) 构建,核心特点包括: 高效启动:通过并行 I/O 操作和懒加载实现 500ms 内初始化 优化循环:基于 ReAct 循环改进,支持流式执行、并行工具调用和自动上下文压缩 安全设计:四层权限检查机制确保系统安全性 扩展架构:支持多 Agent 协作和远程执行,包含 60+ 内置工具 工程优化……

2026-03-31 19:09:02 929

原创 三巨头同时下注同一件事:企业 Agent OS 之战,Microsoft、OpenAI、Google 到底在抢什么

三大科技巨头(微软、OpenAI、谷歌)正在竞相构建企业级AI Agent操作系统,旨在解决AI在企业环境中的落地难题。微软依托Office生态推出Agent 365和Copilot Cowork,实现AI在现有办公软件中的无缝集成;OpenAI通过ChatGPT延伸开发Frontier平台,聚焦企业级AI执行环境;谷歌则以Gemini Enterprise为核心,利用其数据生态优势构建Agent运行平台。

2026-03-31 00:53:41 1404

原创 飞书开源 CLI:不是给你用的,是给 AI 用的

企业软件正在经历范式转移,AI Agent成为主要用户。飞书和钉钉同一周开源CLI工具,飞书CLI将2500+API压缩为200多条命令和19个AI Skill,让AI快速接管飞书操作。CLI成为AI最佳接口,因其自文档化、文本原生和可组合性。飞书CLI采用三层架构设计,覆盖11个业务域,支持Markdown转换等能力。与钉钉CLI不同,飞书采取自上而下开放策略,同时提供CLI、MCP和Skills三种方案。

2026-03-30 17:08:05 868

原创 Code Agent 不是编程工具:它是今天最接近通用 Agent 的现成形态

Code Agent(如Claude Code、CodeBuddy等)正成为当前最接近通用AI Agent的产品形态。与网页版ChatBot相比,Code Agent的核心优势在于深度集成真实工作环境(终端、文件系统、工具链),能直接读写文件、执行命令并持久化结果,实现任务闭环。其能力包括自然语言理解、多模态处理、自主任务拆解、外部工具调用等,尤其适合需要连续操作的高价值工作场景。尽管存在上手门槛和权限风险,但Code Agent已展现出从编程助手向通用工作平台演进的潜力。

2026-03-29 23:20:48 676

原创 Code Agent 的上下文压缩:不是 zip,而是工作记忆管理

本文探讨了四款AI编程助手(Code Agent)的上下文压缩机制,比较了OpenCode、Codex、Claude Code和Pi的设计思路与实现方法。文章指出,上下文压缩不是简单的无损打包,而是将有价值的旧内容重新整理成更短的任务交接单,以便继续工作。四款工具虽实现方式不同,但都遵循分层记忆管理原则:将固定规则、热数据、温数据和冷数据分别处理。核心策略包括保留近期关键信息、生成结构化摘要、隔离子任务等,避免因上下文过长导致模型失效。

2026-03-28 22:28:55 721

原创 OpenAI Frontier 到底是什么:企业 Agent 不只是需要一个更强的模型

OpenAI与亚马逊合作推出的Frontier平台并非新模型或API升级,而是针对企业Agent落地的工程化解决方案。它解决了四大核心问题:上下文割裂、权限管理缺失、工具调用不可靠、缺乏反馈机制。Frontier通过共享上下文、权限感知、执行环境管理和评估优化等机制,为企业Agent提供完整的基础设施支持。与现有技术方案不同,Frontier强调执行层保障和状态维护,使Agent能在企业环境中持续可靠地工作。该平台特别适合面临AI落地困境的工程师和架构师评估采用,但同时也面临企业数据整合等现实挑战。

2026-03-28 21:13:33 387

原创 Harness Engineering:不是写规则,而是设计控制系统

摘要 Harness Engineering 是一种将上下文、约束、验证和反馈机制编码为可执行系统的工程方法,旨在引导 AI agent 生成高质量代码。OpenAI 的实践表明,工程师的核心任务已转向设计环境、明确意图和构建反馈闭环。Harness 包含三层控制结构:Context Engineering(确保 agent 获取精准信息)、Architectural Constraints(通过工具强制代码边界)和 Garbage Collection(持续清理技术债)。其核心是闭环验证与迭代优化——将

2026-03-21 12:33:58 1919

原创 OpenCode 学习指南

OpenCode 是一个开源的 AI 编程助手,类似 Claude Code,但不绑定任何特定 AI 提供商。 本指南帮助你快速理解项目结构、核心模块和关键设计思路。

2026-03-21 12:31:26 1119

原创 一文回顾OpenAI近三年重大发布及历史影响(2022-2025)

从2022年的文本对话,到2025年的多模态物理模拟与自主智能体,OpenAI在三年内完成了传统软件行业可能需要二十年才能完成的技术跨越。一是通过海量数据预训练获得的“世界模型直觉”(GPT系列),二是通过强化学习思维链获得的“逻辑推理能力”(o系列)。站在2025年末,随着GPT-5与Sora 2的全面落地,我们正处于一个新的起点:AI不再仅仅是数字世界的生成器,它正通过Agent和机器人技术,通过Deep Research和Sora的物理模拟,深度介入并重塑我们的现实世界。

2025-11-27 19:57:07 2027

原创 如何通俗的理解操作系统的IO多路复用

下面用“一个服务员照看很多桌子”的比喻起步,然后迅速落到技术细节。

2025-08-28 15:37:35 794

原创 全面解读 Vibe Coding:概念、流程、实践与未来

Vibe Coding(“氛围编程”) 近来在软件开发圈掀起热议。作为一种 由大语言模型(LLM)驱动的全新编程风格,它由人工智能专家安德烈·卡帕斯提(Andrej Karpathy)于2025年初提出,很快风靡业内。本文将面向普通技术爱好者,深入介绍 vibe coding 的起源和词源、定义与本质、典型工作流程、实践技巧、适用场景与优势、潜在风险与局限、工程实践建议,以及未来趋势与争议。希望通过结构清晰、通俗易懂的讲解,帮助读者全面了解这一AI辅助编程新范式。

2025-08-13 13:26:06 14443

原创 上下文工程:为什么ChatGPT的“提示词技巧“已经过时了

宁愿用多个Agent分工,也不要把所有信息压缩进一个超长提示。信息损失往往得不偿失。如果说程序员是"教计算机做事"的人,那么上下文工程师就是"教AI做事"的人。设计信息架构优化知识流动构建协作系统管理经验积累这需要一种新的思维方式:不是"我该给AI什么指令",而是"我该为AI创造什么样的工作环境"。正如建筑师不是在堆砌砖块,而是在创造空间;上下文工程师不是在编写提示词,而是在构建AI的认知世界。记住:提示词是对话,上下文是环境。而环境,决定了一切。你准备好成为一名上下文工程师了吗?

2025-08-08 17:27:57 710

原创 GPT-5技术深度解析:OpenAI的统一智能架构革新

2025年8月7日,OpenAI正式发布GPT-5,标志着大语言模型进入统一架构时代。不同于传统的单一模型迭代,GPT-5采用自适应多模型系统,将推理、生成和多模态能力深度整合,实现了性能与效率的突破性平衡。

2025-08-08 10:07:08 1287

原创 主要科技公司与新创公司 AI Agent 进展调研

AI 智能体(Agent) 正在成为新一代人工智能应用范式,能自主理解意图、规划步骤、调用工具并执行复杂任务[1][2]。当前,国内外多家科技巨头和创业公司都在开发通用型以及垂直领域的 AI Agent 产品。本文将按公司/产品逐一介绍其代理产品的名称定位、主要功能、技术架构、使用方式、应用场景与商业模式,并对比不同策略(如开源 vs. 商业闭源、自主模型 vs. 第三方模型等)的差异。最后附上一个表格对比各产品要点。产品定位:OpenAI 于 2025 年7月推出 ChatGPT Agent,是 Chat

2025-07-23 17:24:12 3762

原创 ChatGPT Agent 深度解析:从“能聊”到“能干”的关键一步

OpenAI 于 2025 年 7 月 17 日发布 ChatGPT Agent 模式,将网页操作(旧 Operator)与深度信息整合(Deep Research)合并,并新增虚拟计算机、终端与多种 Connectors,首次在单一会话内实现“推理 + 执行”的全链路自动化。核心特性包括统一工具箱、长流程沙箱、人机协同授权与安全栈升级;Pro 用户月配额 400 次,Plus/Team 为 40 次。

2025-07-22 10:13:53 1109

原创 Deep Research和Plan and Execute的实现机制

将检索(Retrieval)、阅读(Reading)、分析(Analysis)、总结(Summarization)等环节融为一体,由同一 LLM 模型或一组紧耦合的子模型在内部循环完成。在失败或结果偏差时,可触发“回退-重试”或“动态重规划”。以“给出任务目标,请输出 N 步骤的执行计划”为提示,生成格式化的子任务列表(例如 JSON 数组),包含每步名称、所需工具、输入参数。将计划中的每一步映射到具体工具接口(函数调用、API 请求、子代理),由执行框架负责序列化输入、调用后端、反序列化输出。

2025-05-29 10:17:47 1282

原创 Google Agent 2 Agent 协议深度研究报告

该协议的发布与超过 50 家技术伙伴的支持和贡献同步进行 2,这预示着行业对标准化代理通信的强烈兴趣和 A2A 协议被广泛采用的巨大潜力。随着人工智能代理变得更加复杂并能够处理复杂的任务,它们之间有效协作的需求只会增加,这使得像 A2A 这样的协议对于充分发挥其在企业环境中的潜力至关重要。随着人工智能领域的不断发展,A2A 等协议将在塑造人工智能的未来方面发挥关键作用,从而实现更智能、更通用和更具协作性的代理系统,这些系统能够改变企业处理自动化和数字化转型的方式 2。A2A 演示启用了新的用户体验 10。

2025-04-19 12:03:45 1001

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除