- 博客(994)
- 收藏
- 关注
原创 删掉邮箱后,Agent Trace 仍可能泄露什么:一条可重放脱敏流水线
删掉邮箱后,Trace 仍可能通过工具结果/内部文档/secret/准标识符组合泄密;删得过多又会破坏失败重放。真正的问题不是把更多字符串替换成 ***,而是做可验证转换——删掉不该进入评测资产的内容,同时保留失败复现需要的实体关系、状态变化、工具 Schema、判定条件。风险在 Trace 生成时就出现。OpenAI Agents SDK tracing 默认启用。关闭一个开关不会机械清空其他副本(SDK Trace / 反向代理 / APM / 错误日志 / 工具平台 / 备份 / 标注)。Open
2026-09-02 10:16:03
324
1
原创 RoboLab 解读:机器人策略评测为什么不能只看二元成功率
同一 90% 可能隐藏完全不同的机器人——A 简单抓取稳定但无法处理空间关系;B 完成大部分步骤只在最后放置阶段失败。压缩成同一数字时,能力结构/失败位置/轨迹质量/统计不确定性会同时丢失。NVIDIA RoboLab(v4 / RSS 2026 / arXiv 2604.09860v4)把任务型机器人评测放入 Isaac Lab 高保真模拟:120 任务 / 平均 2.02 子任务 / 9.0 对象 / 难度 2.90 / 68.7% 出现在 DROID 训练词汇中——覆盖事实不直接证明训练数据完全重
2026-09-02 09:27:18
337
原创 同一套 Agent Runtime,为什么 Web、Headless 和 Python SDK 仍然不是同一个产品
同一套 Agent Runtime ≠ 同一个产品。Web/Headless/Python SDK 可复用 Agent Loop/Session/Tool Registry,但产品差异转移到组合配置、宿主生命周期、I/O 协议、凭据、工作区、持久化、版本冻结。DeepSeek Harness 用 Profile + Bundle + Patch 表达边界。Patch 按行 ID 定位替换整段 config(不是任意 YAML 深度合并)。组合顺序:empty → profile bundles → pr
2026-09-01 17:09:23
346
原创 把生产 Agent 事故 Trace 变成可重放的回归测试集
生产环境中 Agent 事故(如误将退款工具当查询工具反复调用)修复后常常复发,根本原因在于日志和 Trace 只是行为记录,并未转化为可重放、可判定、且与训练隔离的回归测试资产。本文提出一套完整方法论:首先用"严重度×复发率×可诊断性×可复现性÷隐私成本"的优先级函数筛选值得入库的事故,避免噪声淹没高价值样本;再通过六步最小化流程(定位偏差点、保留必要上下文、删除无关细节、占位符替换、双向重放验证、人工修正验证)将冗长 Trace 裁剪为最小可执行用例,并写入包含 fixture、runtime、多层 a
2026-08-31 14:24:25
598
8
原创 开放权重之后,为什么 Agent 仍然无法复现:真正缺的是可重放行为证据
开放权重之后,Agent 系统仍难以被真正复现,因为决定其行为的不只是模型权重,还包括系统 Prompt、工具 Schema、权限设置、失败样本、数据配比与评测方式。Hugging Face 与 NVIDIA 在《Data for Agents》中提出 Prompt Atlas,将数据集、流水线、领域、工具使用等维度可视化,揭示不同团队即便拿到相同原始数据,因配比、课程难度、去重与合成方法不同,训练出的 Agent 行为也会不同。文章强调,Agent 执行是一条有状态的行为链(目标→计划→工具调用→结果→重
2026-08-31 13:52:20
429
原创 h3.c 的 fast 模式到底删了什么:六个计算轴不能混成一个开关
h3.c 8974cc0 把 fast=true 拆成 6 个不同计算轴——少 steps、reuse、layers、core-reuse、token-reduction、render-w/h——每个删掉的工作、保留的信息、失效方式都不同。"哪个 preset 最快"不是好问题,"它少算了哪个轴"才是。--reuse 与 --core-reuse 互斥(不是可叠加倍率)。--token-reduction 只在中间 DiT blocks 把目标视频后缀横向相邻 token 配对——文本/音频/条件/参考
2026-08-29 09:18:52
354
4
原创 拆开 Pi Monorepo:改模型、循环、产品和 UI 时,代码应该放在哪一层
Pi v0.82.1 的 4 个核心公开包(pi-ai / pi-agent-core / pi-coding-agent / pi-tui)承接模型 Provider、通用 Agent Runtime、编码产品组合、终端 UI。真实依赖不是单链——pi-coding-agent 同时依赖 AI/Agent Core/TUI。包边界的目标不是减少所有直接依赖,而是阻止一种变化无理由扩散。pi-ai:把模型差异收敛成协议,不接管工作流——"模型能提出动作"与"系统执行动作"必须分开,否则 Provider
2026-08-28 09:32:04
267
3
原创 一次 Agent 失败后,到底该改模型、Prompt 还是 Router?
一次 Agent 失败 Trace 同时暴露模型/Prompt/Router/工具合同/产品逻辑问题。五件事一起改,下次通过也无法回答:哪一项修复了失败,哪一项只是顺便变化,哪一项可能制造新回退。Trace 记录发生了什么,没替团队决定为什么。grader 判定轨迹失败,没有自动证明应该换模型。归因假设必须允许被推翻(observed failure / failed span / attribution hypothesis / disconfirming evidence),否则团队会被带进"先换模
2026-08-28 09:30:13
455
原创 看不见的 Reasoning State,为什么不能拥有看得见的工具权限
看不见的 Reasoning State 不该拥有看得见的工具权限。8-26 预印本把某模型产生的加密推理状态交给同供应商生态中的兼容模型,服务端接受后较弱模型在特制上下文里把隐藏内容转写成文本——不是密文被本地解开,是"票据格式有效但系统没充分限制消费上下文"。两次授权被混成一次:第一层"状态能否被某请求恢复"应绑定租户/用户/会话/模型族/状态序号/有效期;第二层"恢复后模型动作能否执行"——隐藏状态可含旧计划/工具结果/外部内容/其他权限域目标,能恢复状态近似等于能继承旧行动能力。最小工具授权
2026-08-27 11:32:39
446
2
原创 Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态
Claude 文本水印已入正式产品制度,但现有主力模型的逐项覆盖状态仍无法从公开资料审计。Fable 5/Opus 5/Sonnet 5/Haiku 4.5 四个主力全早于 8-2,截至 8-26 帮助页没逐模型清单,模型目录无 watermark_supported 字段。"supported Claude models" 这个限定词决定工程判断能否成立。一份声明三种状态:制度已启动(已签 EU 准则);某模型已支持(8-2 分界,模型 ID + 支持状态字段未公开);某段文本能可靠检测(短文本/编辑
2026-08-27 08:51:53
442
2
原创 262K 跑过,128K 却被脚本拦下:A6000 跑分里的三种“失败”不能混为一谈
262K 跑过、128K 被脚本拦下——三种"失败"不能混:成功完成、客户端跳过、服务端拒绝。128K 的 abort sz=131072 out=1024: only 1170MiB free 是客户端脚本检测空闲显存 < 2 GiB 后直接返回,不是 vLLM 拒绝——没有 HTTP 响应、没有服务端 OOM。262K 阶段实际 prompt 约 185,647 tokens(不是 262,144),目标 128K 实际约 92,772 tokens——"目标档位" ≠ "实际 prompt token
2026-08-26 09:58:39
368
原创 Pi 为什么故意少做功能:极简 Harness 的收益、代价与复杂度转移
Pi 极简主义的真问题是:能力何时进核心、何时外置?外置后账单给谁? v0.82.1 明确不内置 MCP/Sub-agent/Plan Mode/Todo/后台 Bash/逐工具权限弹窗,但允许 Extension/Skill/Package/文件/tmux/独立进程/容器补齐。"不内置" ≠ "不支持"——核心承担跨工作流稳定机制,工作流策略交给外部。外置一项能力至少转移六种责任:发现、权限、观测、兼容、升级、恢复。六类"不做"是六种不同决策:MCP(CLI 适合本地,MCP 适合远程 SaaS)、Sub
2026-08-26 09:15:59
418
原创 机器人接入 AI 连续语音后,端云架构要改什么?
连续语音进入机器人后,声音停止 ≠ 播放/任务/动作同时停止。系统拆三平面:媒体、交互控制、物理动作。五类身份 + trace_id:session/utterance/response/playback/task/action;服务端 sent_at ≠ 用户听见,客户端 received_at ≠ 播放完成,端侧 played_until_ms 是软件进度代理而非声学真值。动作生命周期独立:proposed → authorized → dispatched → acknowledged → runni
2026-08-25 09:29:14
1008
3
原创 我让 Qwen3.8-27B 真改了一次 Git 仓库:工具调用怎样形成 Agent 闭环
之前 27B 服务能返回 JSON 工具调用,但 Agent 任务跑在内存模拟文件系统,没真执行 pytest 也没 Git diff。换成真实 Git + 受限工具 + 独立判定器:临时仓库里 clamp 上下界写反,三条 pytest 必须先红后绿,diff 非空;只开放 5 个受限工具(list_files/read_file/run_tests/apply_patch/git_diff)。普通场景 8 轮闭环:read_file → run_tests(失败) → apply_patch(把 min
2026-08-25 08:50:52
397
原创 单卡 A6000 跑 27B FP8:我把“能跑”拆成了五组证据
"能跑"不等于"可以上生产"。单卡 A6000 跑 27B FP8:长输出 decode 中位 23.48 token/s、JSON Schema 80/80、短 soak 100/100——数字好看但只证明了一组有边界的实验室探针。五层证据表把"跑通"拆开。模型身份:服务别名 qwen3.8-27b、配置架构 Qwen3_5ForConditionalGeneration 已记录,但缺权重来源/revision/SHA-256,不能写成"某官方型号在 A6000 上的速度"。速度拆三段:持续 23.48
2026-08-24 14:45:35
433
5
原创 DeepSeek Harness 为什么不用 messages 数组保存一切
DeepSeek Harness 不用一个可变 messages[] 保存一切,因为原始事实、模型当前视图、请求重建承担三种不同职责。Session Event Log 保存追加式事实,Surface 派生当前模型历史,replacement 用新节点遮蔽旧区间。Session ≠ 已保存:append 成功 ≠ flush 成功 ≠ 恢复成功。Surface 限定三类:只有 user/message、assistant/message、tool/result 直接成为模型消息;其他事件留在日志用于回放/计
2026-08-24 09:59:17
378
原创 多 Agent 不是多开几个终端:Pi 的 Sub-agent 取舍
多 Agent ≠ 多开几个终端。启动第二个 Pi 进程不难,工程难点是:谁定义子任务、谁拥有工作区、什么上下文可传递、失败怎样传播、结果凭什么进主分支。可控 Sub-agent 需要 Task Contract + Workspace + Artifact Envelope + Review Gate。Pi v0.82.1 不在小核心规定唯一 Sub-agent 工作流,提供进程、Session、SDK、Extension、Package 组合入口——原语不等于生产级调度已成立。7 类对象:Task、Co
2026-08-23 09:47:28
488
1
原创 Email Thread 不是 Agent Session:生产级异步通信网关的状态、幂等与审批合同
AgentMail 给 Agent 真实邮箱、Thread、附件、实时事件,但 Email Thread 仍只是通信容器——不是租户、Business Task、Agent Session、长期外发授权。生产系统需要 Communication Gateway。七种对象不能合并:Inbox、Thread、Message、Webhook Event、Agent Session、Business Task、Approval;复合键 (provider, organization_id, inbox_id, th
2026-08-23 09:00:32
419
原创 登录不是授权:高能力 AI 的连续身份保证链
Passkey 提供抗钓鱼认证,但不能独自承担高能力 AI 的访问治理,登录成功不等于授权。七个不能互相替代的环节:Identity Proofing(账户背后是谁)、Authentication(Passkey 主场)、Device Assurance(认证器可信不等于终端可信)、Authorization(谁在何处做什么)、Session Assurance(bearer session 是新薄弱点)、Action Confirmation(登录意图不等于动作意图)、Recovery(最弱恢复路径可击穿
2026-08-22 14:50:39
388
1
原创 33B 音画模型塞进 Apple Silicon,h3.c 重写了哪些 Runtime 职责
本文探讨了推理工具中优化选项的透明度问题,强调应将计算优化拆解为具体可控的开关。h3.c固定版本通过分项控制去噪步数、DiT输出复用、网络深度等参数,使每个优化选项对应不同的计算删减和效果损失。文章详细分析了不同优化轴(如减少steps、复用core residual等)对生成质量的影响机制,并指出组合优化可能引发叠加误差。最后提出一套系统化的验收框架,强调应记录完整计算参数、性能指标与质量缺陷,而非仅依赖总耗时或单一指标评估优化效果。该研究为理解优化开关的代价提供了方法论指导。
2026-08-22 10:04:42
499
原创 模型分数涨了,它真的学会了吗?LittleLearner 拆开了三种可能
《模型分数上涨是否意味着真正学习?LittleLearner研究的启示》 摘要: 研究表明,模型评分提升可能源于三种不同机制:1)获得新能力;2)更稳定调用原有能力;3)评分标准变化带来的表面提升。LittleLearner通过控制预训练数据范围(K-5课程内容)的实验设计,首次系统区分了这些可能性。研究发现:扩展模型规模主要提升边界内能力;SFT和GRPO的效果高度依赖预训练基础;ICL只能改变输出形式而非实质能力;即使pass@1024采样仍存在显著能力边界。研究提出五层验证框架(预训练暴露、后训练数据
2026-08-21 10:17:36
496
原创 DeepSeek Harness:一次 Prompt 如何变成 Turn、Step 与工具事件
这篇文章探讨了DeepSeek Harness中Agent处理用户Prompt的完整生命周期,将其分解为Turn、Step、工具执行等关键阶段。核心观点包括: 消息处理流程分为多层级:Inbox接收输入→Turn建立执行边界→Step处理模型请求→工具批次执行→Session记录可重放事实 Turn代表执行边界,可能包含多个Step(模型往返)或没有Step(如被拒绝时) Step对应单次模型请求及其工具调用,工具执行按批次管理而非单个函数 持久化事件(Session)与实时控制事件(agent/*)需明确
2026-08-21 09:10:10
319
原创 DeepSeek Harness、Codex、Claude Code、LangGraph 应该怎么选:先判断你缺的是产品、底盘还是工作流
本文探讨了如何根据实际需求选择合适的AI开发工具:DeepSeek Harness、OpenAI Codex、Claude Code和LangGraph。文章指出这些工具处于不同层级,分别对应可直接使用的Coding Agent产品(Codex/Claude Code)、可深度重组的Agent Runtime(DeepSeek Harness)和显式编排的工作流框架(LangGraph)。 选择建议: 选择Codex:当需要快速部署成熟的终端编码助手产品,注重工程流程集成和安全审批。 选择Claude Co
2026-08-20 14:27:54
631
原创 Pi Extension 写完不等于可用:从类型检查到真实 Runtime 的证据阶梯
摘要 本文通过开发一个Context Audit扩展,探讨了Pi平台扩展开发中的工程验证问题。文章提出了六层证据阶梯模型,从类型检查到真实运行时验证逐步推进:1)源码契约确认;2)官方类型检查;3)注册与Mock测试;4)真实RPC运行时验证;5)TUI/模型路径测试;6)生产安全验证。重点展示了如何通过RPC方式验证扩展在Pi v0.82.1环境中的实际加载和命令执行能力,同时强调了不同验证层级的独立性。文章指出,扩展开发不应满足于"能运行"的二元判断,而应建立分层次的证据体系,每层只支撑其实际验证过的结
2026-08-20 09:24:53
461
3
原创 Project Trust 不是 Sandbox:Pi Agent 的安全边界怎样补齐
文章摘要 本文分析了Pi Agent的安全边界问题,指出Project Trust机制仅控制项目资源加载,而非进程隔离。作者将安全边界拆分为四层:资源加载、动作授权、操作系统隔离和供应链治理,强调任何单层都无法替代其他层的保护作用。文章具体探讨了Permission Gate的局限性、路径保护被绕过的可能性、供应链风险的直接性,以及容器隔离的价值与局限。核心观点是:有效的安全设计需在各层建立独立强制边界,而非依赖单一机制或模型承诺。建议采用最小权限原则,结合运行时检查、操作系统隔离和供应链审查,形成纵深防御
2026-08-19 09:24:57
475
1
原创 DeepSeek Harness:Subagent、Job、Goal 都叫任务,为什么不能混成一个对象
文章摘要: 在Agent系统中,Subagent、Job和Goal虽然都涉及任务管理,但各自承担不同职责,不能混为一谈。Subagent负责委派工作给子Agent,拥有独立对话历史和工具范围;Job管理后台执行的生命周期,提供统一的状态监控接口;Goal则管理同一Session内的目标状态和轮次控制。三者可以组合使用:例如一个调研Goal可能启动测试Job和查询Subagent,但各自维护独立状态。关键区别在于它们回答不同问题:谁在执行、后台状态如何、为什么继续。取消操作也各不相同:Subagent终止对话
2026-08-19 08:51:41
230
2
原创 DeepSeek Harness:Cordis 如何让插件可卸载、可依赖、可重组
Cordis 插件系统通过生命周期管理解决动态装卸问题,其核心机制包括: Context作用域:作为服务仓库和插件边界,确保服务随作用域销毁而回收 依赖声明:通过inject将启动顺序转化为依赖条件,实现按需激活 双向效应:要求每个注册动作必须附带清理方法,形成完整的装卸闭环 类型化事件:将事件传播模式作为接口契约,确保协调行为可预测 能力接缝:通过Service-Provider-Consumer三角关系定义可替换组件 该系统将插件装载/卸载转化为显式的生命周期图,使动态组合能力成为可能,特别适合需要运行
2026-08-18 10:09:37
668
3
原创 从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线
摘要 本文探讨了构建可验证Agent Harness的方法论,强调应从垂直生产线入手而非全能Agent。通过内容生产案例,提出五个核心状态对象(Task Contract、Run Record、Artifact Manifest、Quality Gate、Checkpoint)和六步生产线流程,实现判断与搬运分离。关键设计原则包括:输入/输出明确绑定、变更范围精准控制、执行器路由可验证。系统通过结构化记录和分层机制(如候选/正式版本分离)确保可观测性,避免"任何修改全量重审"的低效模式。该方法同样适用于代码
2026-08-18 09:02:59
499
2
原创 GPT-Live 分析研究:从回合式语音到连续交互循环
《GPT-Live:从回合式语音到连续交互循环的演进》摘要 OpenAI推出的GPT-Live代表了语音交互技术的重大进步,将传统回合式对话升级为连续交互循环。传统语音Agent面临三大体验瓶颈:错误抢话、无效打断和长任务冻结。GPT-Live通过三个关键创新解决这些问题:首先,采用持续全双工交互,实时决定听、说或打断;其次,分离前台语音循环与后台任务循环,保持交互连续性;最后,建立任务版本管理机制,确保结果时效性。这种架构需要新的评估指标,包括错误抢话率、有效打断识别率等五组事件质量指标。该技术已在Cha
2026-08-17 09:59:21
377
3
原创 给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?
摘要:本文探讨了如何为Pi智能体扩展能力时的五层架构选择策略(Prompt Template、Skill、Tool、Extension、Package)。核心原则是"用最低权限层实现确定性闭环":从可复用的Prompt Template开始,逐步升级至需要运行时强制的Extension。每层对应不同触发主体、确定性要求和风险等级,例如Skill提供渐进披露知识,Tool确保结构化执行,而Package解决分发问题但不替代安全边界。文章通过发布检查清单等场景,演示如何避免过度设计,强调应分层验收而非盲目选择"
2026-08-17 08:37:37
408
原创 Pi 怎样决定模型看见什么:AGENTS.md、SYSTEM.md 与 Skills 的加载边界
摘要: 本文探讨了AI代理Pi在模型上下文管理中的资源加载机制,重点分析了AGENTS.md、SYSTEM.md和Skills等资源文件的加载边界与冲突处理。系统通过ResourceLoader分层管理基础提示词、项目规则和按需技能,但不会自动解决规则冲突。关键发现包括:1)资源加载遵循固定顺序,可能继承隐藏的祖先目录规则;2)SYSTEM与APPEND_SYSTEM分别承担基础替换和增量修改角色;3)Skills采用渐进披露策略,但需明确路由描述和执行边界。作者建议将上下文视为版本化资源集合,建立包含加载
2026-08-16 09:57:25
305
1
原创 从 DeepSeek Harness 看:Tool 注册成功,为什么还不等于安全可用
工具出现在 Tool 列表中,只说明模型知道其名称和参数,并不代表 Provider 已装载、参数经审批、Sandbox 覆盖网络进程,或失败后外部资源已回滚。文章拆解了完整执行链:模型 Schema → 参数冻结 → pre-execute 决策(allow/deny/ask)→ 审批 → monotonic guards(只能拒绝或维持,不能翻转为允许)→ execute wrapper → 工具 body → post policy → 结果规范化 → finalize → 持久化 tool/re
2026-08-16 09:37:53
454
原创 旧对话为什么没有恢复代码:Pi Session Tree 与上下文投影
摘要:Pi的会话树(Session Tree)模型通过树状结构管理对话分支,而非线性历史记录。用户回退到旧对话节点时,仅切换模型读取的历史路径,而不会自动回滚已发生的环境副作用(如文件修改、数据库写入等)。会话状态分为四层:磁盘存储的JSONL文件、逻辑树结构、当前活动路径和模型上下文。Branch、Fork和Clone操作分别用于同一会话内分叉、复制历史路径或创建新任务。关键区别在于会话树仅管理对话记录,环境回滚需独立实现,避免混淆对话回退与系统状态恢复。
2026-08-15 14:54:13
356
1
原创 DeepSeek 把 Agent Core 也插件化了:Harness 的真正赌注
DeepSeek Harness 通过将 Agent 核心功能插件化,实现了高度模块化的 AI Agent 开发架构。其核心创新在于模型适配器、Agent 循环、会话日志、工具注册等核心组件都采用 Cordis 插件系统管理,使开发者能够灵活组合不同功能模块。这种设计减少了代码分支和核心复制需求,但同时也带来了插件图管理、接口契约定义等新挑战。目前仍处于开发者预览阶段,官方警告可能存在兼容性破坏,但已展现出通过插件化实现 AI Agent 产品差异化的潜力,为不同应用场景提供了更细粒度的定制能力。
2026-08-15 14:37:51
350
原创 同一个模型为什么在不同 Agent 里表现不同:模型与 Harness 的责任边界
本文探讨了同一AI模型在不同Agent系统中表现差异的原因,重点分析了模型与外围系统(Harness)的责任边界问题。文章指出,模型表现差异的核心在于四个方面:观察空间(输入信息)、动作空间(可用工具)、反馈语义(执行结果)和状态管理(任务进度)。作者提出五步诊断法来准确定位问题:1)检查模型是否获得完整信息;2)验证可用工具是否合适;3)确认反馈是否准确;4)核查状态管理;5)在前四项无误时再考虑模型能力问题。文章强调,有效的AI系统需要明确划分模型、Harness、执行环境和人工审核的职责,不能将所有问
2026-08-14 10:24:29
279
4
原创 实现 GPT-Live-like:两条路线、一个控制面和六阶段验收
本文探讨如何构建类似GPT-Live的实时语音交互系统,提出两条技术路线和统一控制面的设计方案。文章首先将"像GPT-Live"转化为五项可验收行为:持续输入处理、明确交互动作、可撤销输出、前后台协同和事件可观测性。 提出两条实现路径: 增强级联路线:在现有ASR、LLM、TTS基础上增加连续交互控制 原生音频路线:采用端到端语音模型减少中间层 强调无论选择哪条路线,都需要统一控制面来管理事件身份、会话状态、响应生命周期、任务版本控制和工具权限等核心责任。文章提供了统一事件信封格式和六阶段验收标准,确保系统
2026-08-14 09:41:00
488
原创 Pi Agent 为什么不内置 MCP:工具发现与上下文成本的真实争议
本文探讨了AI助手Pi未内置MCP(模型调用协议)的深层原因,揭示了工具集成的复杂性。文章指出,单纯接入MCP协议并不能自动解决上下文管理、token消耗、权限治理等问题,而CLI方案同样面临隐性成本。作者提出应当区分协议规范与宿主策略,并通过五维成本模型(发现/上下文/结果/治理/运维)评估不同集成方案。Pi采用"小核心+扩展"架构,将标准化成本转移给扩展层,在保持核心简洁的同时允许团队按需选择CLI、Skill、Extension或MCP等方案。最终结论是:没有绝对最优方案,应根据工具规模、复用需求和风
2026-08-13 11:08:20
445
2
原创 GPT-Live 与 GPT-Realtime:产品模型和公开 API 不应混写
本文探讨了产品模型名称与公开API之间的混淆问题,指出产品上线不等于API开放。文章通过分析GPT-Live与GPT-Realtime案例,提出了五层证据框架(产品、模型、接口、权限与行为),强调开发者需要区分产品演示与API实际能力。文章警告了四种常见越界推断,建议代码应基于版本化能力快照而非产品名称进行开发,并提供了具体的安全实践方法,包括能力探测和环境绑定等。最后强调模型接入应保持证据层级分明,避免将产品名称等同于API功能。
2026-08-13 09:04:16
607
1
原创 上下文装不下以后:Pi Compaction 怎样压缩历史,又会丢掉什么
本文探讨了AI编码助手Pi在长时会话中的上下文压缩机制(Compaction),揭示了其工作原理与潜在信息损失。文章指出: 压缩机制通过结构化摘要和保留近期原文来平衡上下文限制,但本质是有损投影,关键执行状态需进入数据层而非依赖自然语言摘要。 系统通过两种预算分配(保留空间与近期原文)决定压缩触发点,并确保不在工具调用结果处切断消息链以保持执行连贯性。 对于超长单轮对话采用Split Turn处理,保留必要上下文解释后续消息。 结构化摘要仍存在信息失真风险,如误记任务状态、丢失否定条件等,文件轨迹系统也仅提
2026-08-12 10:06:52
482
5
原创 打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛
文章摘要 本文探讨了语音交互系统中打断机制的完整实现路径。作者指出,真正的自然打断不是简单的VAD检测,而需要经历六个收敛阶段:从候选事件检测到物理停止,再到历史修复的状态链。关键点包括: VAD事件不等于话权决策,需要结合多维度证据; 重叠声音应分类为竞争性打断、听者附和、旁人语音和环境声四种类型; 完整打断流程包含六个状态阶段,每个阶段都需要独立确认; 系统需要区分生成、发送、缓冲和播放四个进度; 历史修复必须与播放停止绑定相同的response_id。 文章提供了实用的工程方案,包括六阶段状态机设计、
2026-08-12 09:09:33
781
1
neo4j-community-3.5.17-unix.tar.gz 是 Neo4j 官方发布的 社区版
2025-10-14
Git的基本内容介绍
2024-10-08
大模型对生活和工作的改变
2024-09-28
人工智能时代,程序员如何保持核心竞争力?
2024-09-25
关于#Spark# #Flink#的问题,如何解决?
2024-09-24
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅