自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(57)
  • 收藏
  • 关注

原创 6个AI,同一道题:CodeFlowMu 多 Agent 团队巡检实测

六个AI团队执行相同巡检任务,四轮交付、两轮终止。沿CodeFlowMu与FCoP记录分析派单、报告质量、耗时、接入故障及独立EVAL,并保留原始证据与实验局限。

2026-09-10 13:37:00 172

原创 恢复限流为何失效:计数被清理代码删掉了

Orca 的原模块对照实验显示,保护措施可能在自己的清理路径上失效;关键不在增加重试限制,而在让动作和额度读取同一个对象事实。

2026-09-10 11:45:52 102

原创 并发上限为 1 仍跑出 2 个任务:信号量到底属于谁

AG2 原方法对照实验表明:候选修复守住了每个事件循环的并发上限,双循环合计仍可为二。验收必须写清额度属于哪个范围。

2026-09-10 11:42:03 75

原创 认证文件少了,环境变量却多了:一次凭证隔离检查

一组固定版本实验表明,文件写入归零可能只是秘密换了一条传递路径。判断隔离,要看接收方最终能拿到什么。

2026-09-10 11:30:33 205

原创 工具结果被拦住了,为什么操作还是发生了?

原中间件实验中,同一次工具调用留下 executed 和 blocked 两条回执。两者并不矛盾:调用权限与结果流出权限约束的是不同阶段。

2026-09-09 16:10:46 137

原创 只改了一句备注,评估通过率为什么从 100% 变成 0%?

真实聚合函数的隔离实验表明:顺序稳定可以与证据冲突被隐藏同时成立。问题不在排序是否确定,而在排序被赋予了怎样的判断权。

2026-09-09 16:10:45 171

原创 检查通过,为什么还不能立刻放心?从启动准入到文件落盘的最后一段距离

检查前改变源文件,旧批准被拒绝;在检查后注入变化,真实执行器复制了新字节。两组时间对照说明:检查绑定了什么,与这些事实能否保持到动作发生,是不同问题。

2026-09-08 15:56:10 176

原创 明明写了“不覆盖”,为什么文件还是被替换了?一次 Agent 工具合同实验

同样的“不覆盖”参数,写入拒绝,复制和移动却替换了目标。穿过真实审批服务与文件执行器的对照说明:限制被记录、被绑定与被执行,是三件不同的事。

2026-09-08 15:51:00 144

原创 回执坏了,为什么任务没有再跑一遍?一次真实调度链的反例实验

损坏回执让命令再次进入执行回调,却没有让实际调度模块再启动一次执行。我们用两轮实验追到会话、租约和持久化幂等层,区分读取异常、重复调用与重复效果,也收窄了真正值得评审的缺口。

2026-09-08 15:45:28 161

原创 同一个 Agent,换个人指挥,权限也会跟着换吗?

从 Paperclip 的共享 Agent 凭据选择出发,我们检查了 CodeFlowMu 的主体绑定与指令来源链:Agent 身份受到保护,但消息引用、真人责任与动作权限并不是同一层。一次字段投影对照,揭示了应该先补清哪段证据,而不是立即重建身份平台。

2026-09-08 15:35:54 247

原创 工信部《人工智能中小企业创业支持计划》深度解读:AI创业生态正在形成

工信部《人工智能中小企业创业支持计划(2026—2028年)》把算力、数据、场景、开源、资本和服务保障纳入同一框架,AI创业生态正在从政策方向走向组织实施。

2026-09-08 12:00:13 1987 1

原创 文件确实写成功了,为什么还要检查成果?从远程沙箱到本地工作区

通过真实写入、新进程读回与改名对照,区分历史成功与当前可取回;同时核对工作区、任务身份与旧批准的适用范围。

2026-09-07 12:36:43 220

原创 点了取消,究竟取消了哪一步?一次 Agent 执行边界实验

取消待审批请求、结束会话、动作前中止是三个边界。通过真实审批服务与适配器的受控实验,区分请求、回执与效果。

2026-09-07 12:06:41 413

原创 两条指令都保存了,为什么恢复后意思反了?从 Codex 到 Agent 上下文的接受顺序

顺序本身也是上下文的一部分。两条输入一条没丢,只因保存顺序与接受顺序不同,重放结果就可能翻转。受 Codex 改动启发,我们用七组受控实验区分收到、接受、保存、恢复与授权;并未证实 CodeFlowMu 存在真实会话排序缺陷。

2026-09-06 13:28:47 295

原创 只发 GET,为什么还是写进去了?从公共 Wiki 到 Agent 工具门禁的效果边界

GET 有只读的规范语义,却不是服务端行为的强制保证。我们从本机保存实验出发,穿过 CodeFlowMu 现有工具门禁,发现受测 GET 的效果尚未识别完整,却因没有命中写风险而获得放行。

2026-09-06 13:22:44 296

原创 工信部414号文深度解读:从模型供给走向应用交付

工信厅科函〔2026〕414号以资源池、服务团、真实场景和持续评估,推动人工智能应用服务商形成可规模化的交付能力。本文解读政策机制、参与要求与应用交付机会。

2026-09-05 01:44:11 435

原创 批准了这条命令,为什么另一条也能过?一次 Agent 授权摘要实验

在同一条 Agent 审批链上,改 Git 分支没有改变授权摘要,只换 Session 却改变了摘要。真实服务、跨进程记录和正反对照揭示:风险分类、动作身份与执行授权,不能交给同一个含糊的‘相同’。

2026-09-05 00:54:01 329

原创 进程还活着,原来的执行者还在吗?

Codex 的 Windows 进程身份改动提醒我们:PID 存活不等于原执行者仍在。对 CodeFlowMu 两套记录的受控比较发现,写锁已经能识别时间矛盾,审批执行记录却仍可能保留 executing。

2026-09-04 12:39:17 194

原创 测试结果是空的,为什么还显示“验证通过”?

计划要求四项测试,结果却可以在零项回执时变成 VERIFIED。一次穿过真实 Host 准入服务的受控实验表明:没有收到失败,不等于已经收齐成功证据。

2026-09-04 11:33:17 324

原创 Cursor 正在成为 Agent 的 iOS 吗?

Self-Hosted Machines、长生命周期 Agent 与事件订阅正在勾勒 Cursor 的平台位置。本文讨论从操作软件到交代工作的变化,以及企业如何把通用 Agent 能力组织成自己的数字员工。

2026-09-04 11:27:37 456

原创 全球真实数字员工与 SaaW 商业全景报告 2026-3

比较 23 个公开项目与不同协议的职责边界,讨论多智能体岗位协作、本地运行、人类监督及 CodeFlowMu 的产品路线。

2026-09-03 11:21:57 532

原创 全球真实数字员工与 SaaW 商业全景报告 2026-2

区分模型能力与系统交付可靠性,分析数字员工的证据、权限、恢复、收费结构和岗位准入条件。

2026-09-03 10:59:33 257

原创 全球真实数字员工与 SaaW 商业全景报告 2026-1

从自研小典 AI 与 CodeFlowMu 的工程实践出发,建立数字员工的判定框架,比较全球 55 个产品条目的岗位持续性、工具能力与交付边界。

2026-09-03 10:53:45 907

原创 事实核查、诊断和 EVAL 都有了,为什么 Agent 接管仍缺证据链?

57 项既有测试证明职责隔离,不证明接管证据已经贯通。结合 receipt 引用缺失和原文投影探针,区分历史回执、当前授权与接管记录,让决定可追溯,但不给旁观组件调度权。

2026-09-02 14:19:26 215

原创 Agent 中断后,原任务如何安全接管?从恢复标记到效果事实

TASK 文件仍在,并不代表原动作没有发生。基于 CodeFlowMu V2.1.2 的受控探针,区分执行权、效果事实与接管准入:什么时候可以重新执行,什么时候只能对账,什么时候必须待核对。

2026-09-02 14:13:24 308

原创 内部事件为什么不能直接返回前端?Agent Activity 的递归白名单投影实践

历史 Activity 中 raw 很常见,但历史文件不能直接证明当前出口风险。本文用真实查询标记定位边界,介绍服务端消费者绑定与递归白名单,保留 19/20→20/20 的误裁回归,以及独立 QA 中禁止字段消失、必要字段保留的双向验证。

2026-08-31 14:11:48 169

原创 日志有 session_id 就可信了吗?Agent 技能调用的会话核验与证据边界

59 条历史技能记录都有完整性字段,却全部缺少 session_id。V2.1.2 不只补字段,而是对照 SessionStore 核验调用归属,区分 verified、合法 sessionless 和 invalid_claim,并保持调用成功与工程结果验收的边界。

2026-08-31 14:04:41 312

原创 工具报错后还能重试吗?用持久化幂等避免重复创建 Agent 任务

一次受控响应丢失实验中,报告仍是一份,任务却建了两次。本文拆解 V2.1.2 的稳定提交身份、规范摘要、三阶段回执与恢复规则,并给出响应丢失和八路并发的独立 QA 结果及适用边界。

2026-08-31 13:53:46 177 2

原创 一盏绿灯到底在说什么?从 Sutando 的协作者进度缺失看 Agent 界面的状态投影边界

从 Sutando 的协作者进度反例出发,说明 Agent 界面的绿灯不是事实本身:状态必须明确来源、对象、时效与它不能替代的结论。

2026-08-28 13:15:13 353

原创 从“证据不能串账”到动态诊断:CodeFlowMu V2.0.4 如何把研究结论做成工程能力

从 10 条脱敏 REPORT 的 4/4/2 对账发现出发,复盘 CodeFlowMu V2.0.4 如何把证据归属研究做成随任务阶段动态重算、只读且不替验收签字的诊断能力。

2026-08-28 13:09:34 517

原创 绿勾只代表现在:从 CrewAI 的失败遥测修复看 Agent 的交付边界

从 CrewAI 的失败遥测修复和 CodeFlowMu 的报告投影缺陷出发,说明技术失败、交付证据、当前状态、正式验收与历史必须分层保存。

2026-08-27 14:38:13 345

原创 Agent 有工具权限,为什么还要为每一次执行重新核对?从 GitHub MCP 到任务证据链

从 CodeFlowMu 一次真实门禁误拦与连续回归数据出发,对照 GitHub MCP 的调用时 scope challenge,研究静态工具能力与当前执行授权之间为什么仍需要任务证据链。

2026-08-27 14:28:51 360

原创 多 Agent 团队治理(3/3):轨道机如何服务自主工作而不越权

自动化不能越过授权边界。本文说明轨道机可以机械拒绝什么,以及何时必须把决定交还给 Agent、PM 或 ADMIN。

2026-08-24 16:36:47 461

原创 多 Agent 团队治理(2/3):任务如何领取、执行、审查与完成

一张 TASK 文件如何被领取、执行、审查和完成?本文检查状态迁移、原子发布、并发认领与可恢复边界。

2026-08-24 16:35:09 395

原创 多 Agent 团队治理(1/3):治理模型、文件状态机与工程轨道机

多个模型会话不会自动组成团队。本文说明 TMPA、FCoP 与 CodeFlowMu 怎样分别承担治理语义、状态事实和工程执行。

2026-08-24 16:33:05 435

原创 AI 团队同时交回三份报告,怎样保证验收没有串账?

可靠验收不能只看报告文件名,而要让运行身份、机器证据、任务契约和有权的接纳决定同时指向同一次执行。

2026-08-22 16:41:50 189

原创 切换项目后,Agent 为什么还在改旧目录?一条执行链怎样安全换根

项目切换不是改一个界面路径,而是停止旧副作用、保存规范化新根、重建所有根目录消费者,并证明任务与证据始终绑定同一物理工作区。

2026-08-22 15:23:03 306

原创 AI Agent 的技能不是工具权限:为什么“会怎么做”和“允许做什么”必须分开?

Skill 可以教会 Agent 怎样完成工作,但真正授权副作用的必须是确定性的角色能力、操作策略、单次批准与系统权限。

2026-08-22 15:07:33 396

原创 别被“全绿演示”骗了:怎样用故障注入,测出一个真正靠谱的 AI Agent 调度系统?

可靠性测试不该围绕页面是否跑通,而应把一条不可破坏的铁律、一个故障插入位置和一个可检查结果组合成可复现测试。

2026-08-20 15:39:12 243

原创 两万字需求,怎样拆成 AI 团队能落地的施工图?

长需求不该被压缩成漂亮摘要,而应编译成带来源、责任、依赖、验收证据和恢复路径的任务图,再由确定性校验与人类批准控制开工。

2026-08-20 15:35:53 492

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除