- 博客(57)
- 收藏
- 关注
原创 6个AI,同一道题:CodeFlowMu 多 Agent 团队巡检实测
六个AI团队执行相同巡检任务,四轮交付、两轮终止。沿CodeFlowMu与FCoP记录分析派单、报告质量、耗时、接入故障及独立EVAL,并保留原始证据与实验局限。
2026-09-10 13:37:00
172
原创 恢复限流为何失效:计数被清理代码删掉了
Orca 的原模块对照实验显示,保护措施可能在自己的清理路径上失效;关键不在增加重试限制,而在让动作和额度读取同一个对象事实。
2026-09-10 11:45:52
102
原创 并发上限为 1 仍跑出 2 个任务:信号量到底属于谁
AG2 原方法对照实验表明:候选修复守住了每个事件循环的并发上限,双循环合计仍可为二。验收必须写清额度属于哪个范围。
2026-09-10 11:42:03
75
原创 认证文件少了,环境变量却多了:一次凭证隔离检查
一组固定版本实验表明,文件写入归零可能只是秘密换了一条传递路径。判断隔离,要看接收方最终能拿到什么。
2026-09-10 11:30:33
205
原创 工具结果被拦住了,为什么操作还是发生了?
原中间件实验中,同一次工具调用留下 executed 和 blocked 两条回执。两者并不矛盾:调用权限与结果流出权限约束的是不同阶段。
2026-09-09 16:10:46
137
原创 只改了一句备注,评估通过率为什么从 100% 变成 0%?
真实聚合函数的隔离实验表明:顺序稳定可以与证据冲突被隐藏同时成立。问题不在排序是否确定,而在排序被赋予了怎样的判断权。
2026-09-09 16:10:45
171
原创 检查通过,为什么还不能立刻放心?从启动准入到文件落盘的最后一段距离
检查前改变源文件,旧批准被拒绝;在检查后注入变化,真实执行器复制了新字节。两组时间对照说明:检查绑定了什么,与这些事实能否保持到动作发生,是不同问题。
2026-09-08 15:56:10
176
原创 明明写了“不覆盖”,为什么文件还是被替换了?一次 Agent 工具合同实验
同样的“不覆盖”参数,写入拒绝,复制和移动却替换了目标。穿过真实审批服务与文件执行器的对照说明:限制被记录、被绑定与被执行,是三件不同的事。
2026-09-08 15:51:00
144
原创 回执坏了,为什么任务没有再跑一遍?一次真实调度链的反例实验
损坏回执让命令再次进入执行回调,却没有让实际调度模块再启动一次执行。我们用两轮实验追到会话、租约和持久化幂等层,区分读取异常、重复调用与重复效果,也收窄了真正值得评审的缺口。
2026-09-08 15:45:28
161
原创 同一个 Agent,换个人指挥,权限也会跟着换吗?
从 Paperclip 的共享 Agent 凭据选择出发,我们检查了 CodeFlowMu 的主体绑定与指令来源链:Agent 身份受到保护,但消息引用、真人责任与动作权限并不是同一层。一次字段投影对照,揭示了应该先补清哪段证据,而不是立即重建身份平台。
2026-09-08 15:35:54
247
原创 工信部《人工智能中小企业创业支持计划》深度解读:AI创业生态正在形成
工信部《人工智能中小企业创业支持计划(2026—2028年)》把算力、数据、场景、开源、资本和服务保障纳入同一框架,AI创业生态正在从政策方向走向组织实施。
2026-09-08 12:00:13
1987
1
原创 文件确实写成功了,为什么还要检查成果?从远程沙箱到本地工作区
通过真实写入、新进程读回与改名对照,区分历史成功与当前可取回;同时核对工作区、任务身份与旧批准的适用范围。
2026-09-07 12:36:43
220
原创 点了取消,究竟取消了哪一步?一次 Agent 执行边界实验
取消待审批请求、结束会话、动作前中止是三个边界。通过真实审批服务与适配器的受控实验,区分请求、回执与效果。
2026-09-07 12:06:41
413
原创 两条指令都保存了,为什么恢复后意思反了?从 Codex 到 Agent 上下文的接受顺序
顺序本身也是上下文的一部分。两条输入一条没丢,只因保存顺序与接受顺序不同,重放结果就可能翻转。受 Codex 改动启发,我们用七组受控实验区分收到、接受、保存、恢复与授权;并未证实 CodeFlowMu 存在真实会话排序缺陷。
2026-09-06 13:28:47
295
原创 只发 GET,为什么还是写进去了?从公共 Wiki 到 Agent 工具门禁的效果边界
GET 有只读的规范语义,却不是服务端行为的强制保证。我们从本机保存实验出发,穿过 CodeFlowMu 现有工具门禁,发现受测 GET 的效果尚未识别完整,却因没有命中写风险而获得放行。
2026-09-06 13:22:44
296
原创 工信部414号文深度解读:从模型供给走向应用交付
工信厅科函〔2026〕414号以资源池、服务团、真实场景和持续评估,推动人工智能应用服务商形成可规模化的交付能力。本文解读政策机制、参与要求与应用交付机会。
2026-09-05 01:44:11
435
原创 批准了这条命令,为什么另一条也能过?一次 Agent 授权摘要实验
在同一条 Agent 审批链上,改 Git 分支没有改变授权摘要,只换 Session 却改变了摘要。真实服务、跨进程记录和正反对照揭示:风险分类、动作身份与执行授权,不能交给同一个含糊的‘相同’。
2026-09-05 00:54:01
329
原创 进程还活着,原来的执行者还在吗?
Codex 的 Windows 进程身份改动提醒我们:PID 存活不等于原执行者仍在。对 CodeFlowMu 两套记录的受控比较发现,写锁已经能识别时间矛盾,审批执行记录却仍可能保留 executing。
2026-09-04 12:39:17
194
原创 测试结果是空的,为什么还显示“验证通过”?
计划要求四项测试,结果却可以在零项回执时变成 VERIFIED。一次穿过真实 Host 准入服务的受控实验表明:没有收到失败,不等于已经收齐成功证据。
2026-09-04 11:33:17
324
原创 Cursor 正在成为 Agent 的 iOS 吗?
Self-Hosted Machines、长生命周期 Agent 与事件订阅正在勾勒 Cursor 的平台位置。本文讨论从操作软件到交代工作的变化,以及企业如何把通用 Agent 能力组织成自己的数字员工。
2026-09-04 11:27:37
456
原创 全球真实数字员工与 SaaW 商业全景报告 2026-3
比较 23 个公开项目与不同协议的职责边界,讨论多智能体岗位协作、本地运行、人类监督及 CodeFlowMu 的产品路线。
2026-09-03 11:21:57
532
原创 全球真实数字员工与 SaaW 商业全景报告 2026-1
从自研小典 AI 与 CodeFlowMu 的工程实践出发,建立数字员工的判定框架,比较全球 55 个产品条目的岗位持续性、工具能力与交付边界。
2026-09-03 10:53:45
907
原创 事实核查、诊断和 EVAL 都有了,为什么 Agent 接管仍缺证据链?
57 项既有测试证明职责隔离,不证明接管证据已经贯通。结合 receipt 引用缺失和原文投影探针,区分历史回执、当前授权与接管记录,让决定可追溯,但不给旁观组件调度权。
2026-09-02 14:19:26
215
原创 Agent 中断后,原任务如何安全接管?从恢复标记到效果事实
TASK 文件仍在,并不代表原动作没有发生。基于 CodeFlowMu V2.1.2 的受控探针,区分执行权、效果事实与接管准入:什么时候可以重新执行,什么时候只能对账,什么时候必须待核对。
2026-09-02 14:13:24
308
原创 内部事件为什么不能直接返回前端?Agent Activity 的递归白名单投影实践
历史 Activity 中 raw 很常见,但历史文件不能直接证明当前出口风险。本文用真实查询标记定位边界,介绍服务端消费者绑定与递归白名单,保留 19/20→20/20 的误裁回归,以及独立 QA 中禁止字段消失、必要字段保留的双向验证。
2026-08-31 14:11:48
169
原创 日志有 session_id 就可信了吗?Agent 技能调用的会话核验与证据边界
59 条历史技能记录都有完整性字段,却全部缺少 session_id。V2.1.2 不只补字段,而是对照 SessionStore 核验调用归属,区分 verified、合法 sessionless 和 invalid_claim,并保持调用成功与工程结果验收的边界。
2026-08-31 14:04:41
312
原创 工具报错后还能重试吗?用持久化幂等避免重复创建 Agent 任务
一次受控响应丢失实验中,报告仍是一份,任务却建了两次。本文拆解 V2.1.2 的稳定提交身份、规范摘要、三阶段回执与恢复规则,并给出响应丢失和八路并发的独立 QA 结果及适用边界。
2026-08-31 13:53:46
177
2
原创 一盏绿灯到底在说什么?从 Sutando 的协作者进度缺失看 Agent 界面的状态投影边界
从 Sutando 的协作者进度反例出发,说明 Agent 界面的绿灯不是事实本身:状态必须明确来源、对象、时效与它不能替代的结论。
2026-08-28 13:15:13
353
原创 从“证据不能串账”到动态诊断:CodeFlowMu V2.0.4 如何把研究结论做成工程能力
从 10 条脱敏 REPORT 的 4/4/2 对账发现出发,复盘 CodeFlowMu V2.0.4 如何把证据归属研究做成随任务阶段动态重算、只读且不替验收签字的诊断能力。
2026-08-28 13:09:34
517
原创 绿勾只代表现在:从 CrewAI 的失败遥测修复看 Agent 的交付边界
从 CrewAI 的失败遥测修复和 CodeFlowMu 的报告投影缺陷出发,说明技术失败、交付证据、当前状态、正式验收与历史必须分层保存。
2026-08-27 14:38:13
345
原创 Agent 有工具权限,为什么还要为每一次执行重新核对?从 GitHub MCP 到任务证据链
从 CodeFlowMu 一次真实门禁误拦与连续回归数据出发,对照 GitHub MCP 的调用时 scope challenge,研究静态工具能力与当前执行授权之间为什么仍需要任务证据链。
2026-08-27 14:28:51
360
原创 多 Agent 团队治理(3/3):轨道机如何服务自主工作而不越权
自动化不能越过授权边界。本文说明轨道机可以机械拒绝什么,以及何时必须把决定交还给 Agent、PM 或 ADMIN。
2026-08-24 16:36:47
461
原创 多 Agent 团队治理(2/3):任务如何领取、执行、审查与完成
一张 TASK 文件如何被领取、执行、审查和完成?本文检查状态迁移、原子发布、并发认领与可恢复边界。
2026-08-24 16:35:09
395
原创 多 Agent 团队治理(1/3):治理模型、文件状态机与工程轨道机
多个模型会话不会自动组成团队。本文说明 TMPA、FCoP 与 CodeFlowMu 怎样分别承担治理语义、状态事实和工程执行。
2026-08-24 16:33:05
435
原创 AI 团队同时交回三份报告,怎样保证验收没有串账?
可靠验收不能只看报告文件名,而要让运行身份、机器证据、任务契约和有权的接纳决定同时指向同一次执行。
2026-08-22 16:41:50
189
原创 切换项目后,Agent 为什么还在改旧目录?一条执行链怎样安全换根
项目切换不是改一个界面路径,而是停止旧副作用、保存规范化新根、重建所有根目录消费者,并证明任务与证据始终绑定同一物理工作区。
2026-08-22 15:23:03
306
原创 AI Agent 的技能不是工具权限:为什么“会怎么做”和“允许做什么”必须分开?
Skill 可以教会 Agent 怎样完成工作,但真正授权副作用的必须是确定性的角色能力、操作策略、单次批准与系统权限。
2026-08-22 15:07:33
396
原创 别被“全绿演示”骗了:怎样用故障注入,测出一个真正靠谱的 AI Agent 调度系统?
可靠性测试不该围绕页面是否跑通,而应把一条不可破坏的铁律、一个故障插入位置和一个可检查结果组合成可复现测试。
2026-08-20 15:39:12
243
原创 两万字需求,怎样拆成 AI 团队能落地的施工图?
长需求不该被压缩成漂亮摘要,而应编译成带来源、责任、依赖、验收证据和恢复路径的任务图,再由确定性校验与人类批准控制开工。
2026-08-20 15:35:53
492
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅