- 博客(86)
- 收藏
- 关注
原创 明略科技携手海康机器人亮相世界机器人大会,以“Agent+具身“联合进入商业机器人场景
明略科技聚焦VLM/VLA(视觉语言模型/视觉语言动作模型),针对商用服务机器人在非结构化场景中的作业难点,构建多模态感知、智能推理规划与多智能体协同的核心智能能力,旗下明胜品智深耕线下餐饮场景营运智能多年,积累大量数据与行业knowhow,对企业实际运营流程和需求有深刻理解;未来,明略科技希望打造AI Native的组织智能——让每一个智能体、每一台机器人,都成为会思考、能协作、有共同记忆的组织成员,与人类员工彼此协同、相互成就,让组织作为一个整体持续进化。机器人智能的进化,往往由真实商业应用牵引。
2026-08-26 18:37:47
253
原创 Octo Loop上线:让长任务跑出聊天框
但当任务拉长到数小时、需要多个执行者协作,或者人要中途离开再回来时,问题就出现了:上下文散在几百条消息里,哪个任务正在执行、哪个在等人、哪个已经交付,很难一眼看清;和主要用于执行单次任务的 Runtime 相比,这类 Agent 更强调长期记忆:它持续理解用户、团队和对话的历史背景,知道正在讨论什么,也能够逐渐形成对用户工作方式的理解。进入 Loop 后,工作就不再只是一条埋在聊天记录里的消息,而会成为一个个有目标、有负责人、有状态、有执行过程和交付结果的独立任务,可以分配给成员、专家或专家团。
2026-08-05 18:36:00
234
原创 为什么AI产出总是丢?从聊天记录到回路,任务管理的范式迁移
Jira、Linear、Trello、Asana走的都是这条路,先建一张卡片或者一个issue,填好标题、描述、负责人、截止日期、优先级,然后把任务分配下去,执行过程中的讨论挂在卡片底下,完成后关单。每个回路有负责人,可以是人也可以是智能体;ChatGPT、Claude、各种AI编程助手,所有工具的界面都是一个对话框,你说它做,做完了产出就躺在对话流里,被后续的消息一点点推到上面,一周后想找基本靠运气,搜关键词搜不到,因为你不记得当时用了什么词,翻记录翻得手指疼,因为对话和产出混在一起没有任何结构化标记。
2026-08-03 14:36:59
201
原创 打回三次之后,AI终于学会了我的品味——经验沉淀为什么是AI协作的隐形壁垒
第三步是组合化,不同智能体、不同人沉淀的卡片在同一个任务里碰撞,写文案的智能体的偏好和做数据的智能体的偏好在一次协作中同时被召回,不同来源的知识组合出新的行为约束。这个方案在纯代码场景里勉强够用,但放到更复杂的工作流里就撑不住了,写报告和写代码的偏好不一样,做数据分析和做PPT的审美不一样,一个静态文件根本装不下不同任务类型下微妙的风格差异,更不用说那些"这次为什么打回"的具体反馈——你告诉它"这段太虚了给我加数据",这条反馈不应该只作用于当次修改,下次写类似段落它应该自动知道要先找数字。
2026-08-03 14:33:59
200
原创 MCP 协议第五次更新,AI Agent 的“USB 接口“走到哪一步了
这个类比其实比"AI 的 USB 接口"更准确,USB 解决的是硬件接口的物理和协议标准,MCP 解决的是 Agent 和工具之间的会话层协议,工具怎么注册、参数怎么声明、返回结果怎么结构化、资源怎么读取、提示词模板怎么分发,这些在 MCP 之前每个框架都有自己的一套写法,LangChain 有 LangChain Tools,AutoGen 有 AutoGen 的 function calling 格式,各家 Agent 平台之间工具基本不互通。MCP 解决的问题有明确的边界。
2026-08-03 14:28:41
559
原创 为什么多智能体协作火了?Octo的解法
任务执行中产生的反馈需要有沉淀机制,一次验收被打回的原因、一次代码审查中发现的典型问题、用户在验收环节表达的偏好,这些信息如果只停留在当次对话里下次执行类似任务时就会重复踩坑,Octo的Preference经验系统把每次验收和打回产生的信号挂载到智能体和项目维度,下次接同类任务时自动加载,这部分是越用越准的,跑过三个月真实任务的智能体和新部署的智能体在产出风格和对项目上下文的理解上会有本质差异。Swarm面对同一个任务启动多个独立Agent,各自完成完整的解决方案,最终从多个方案中选择最优的一版。
2026-08-03 14:17:33
219
原创 明略科技 WebRetriever 全球挑战赛报名开启,15000 美元奖池等你来赢!
方式二(推荐):如果你有 Claude Code、ChatGPT Codex、Cursor 等 AI 编程 助手,可通过 https://mininglamp-ai.github.io/WebRetriever_Challenge/join/ 在终端内快速完成注册,无需浏览器操作。规模领先——覆盖 800 个真实在线网站、1,550 项跨行业任务,横跨科技、金融、医疗、教育、政务等八大领域,全程真实互联网环境。赛事平台 Octo:https://im.deepminer.com.cn/
2026-08-03 10:40:41
205
原创 大模型API价格打到这个程度之后,真正的竞争在拼什么
一个任务从派单到验收的流程在Octo里是这样跑的:人在IM里和助理想清楚需求,助理由对话上下文生成结构化的任务说明包含背景、目标和验收标准,然后在回路里创建任务指派给对应的专家或专家团;专家是执行者,每次执行上下文干净,跑在指定运行时上,由系统提示词明确定义角色边界,挂载不超过十个技能,绑定独立工作目录。把沟通和执行分开是因为长任务天然不适合在聊天流里跑,五分钟没回复你不知道它是在干活还是卡死了,同一条讨论串里发新消息还可能打断正在执行的任务,这些问题在IM界面里是结构性的,靠优化交互解决不了。
2026-07-31 15:20:11
195
原创 Loop Engineering 如何让 AI 智能体真正把活干完,我们在 Octo 中的回路设计与实践
ClaudeCode开发者提出LoopEngineering概念,将单次指令调用转变为迭代闭环。Octo团队在此基础上开发回路(Loop)功能,解决多Agent协作问题。设计区分助理和专家角色,通过IM通讯层与任务执行层分离实现高效协作,支持任务派发、执行和验收全流程。关键设计包括自动生成任务说明、专家技能组合和系统提示词定义流程。实际应用中显著减少人工干预时间,支持异步通知和经验沉淀。Octo已在GitHub开源,支持私有部署和多平台接入。目前明略科技内部有数千员工和智能体使用该系统进行日常协作
2026-07-31 14:22:08
230
原创 Octo:为AI设计的协作层:回路、信息流和经验沉淀
Octo 管身份、能力注册和行为记录,不管推理执行——这层分离意味着不锁定模型厂商,也意味着可以私有部署,octo-deployment 提供了生产级 K8s 清单和 Kustomize 分层配置,数据全留在自己基础设施里。你打回文档 Agent 的产出说"开头直接说结论,不要铺垫",这条反馈不会丢在聊天记录里,它变成这个智能体的长期经验,下次写文档自动参考。智能体接到任务自动开始执行,全过程产出、讨论、修改全挂在回路时间线上,交付后发起人验收,通过就关单,不通过打回重做。现在团队里的 AI 已经不少了。
2026-07-28 17:16:36
714
原创 别再被跑分骗了:大模型 Benchmark 到底在考什么
MMLU 覆盖57个学科的选择题,从高中数学到法学到医学都有,它确实能反映一个模型的知识广度和选择题作答能力,但它不测长文本连贯性,不测多轮对话里的上下文保持,不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链,chain-of-thought 能力强的模型在这两个榜上分数好看,可真实工作中遇到的数学问题从来不是"小明有三个苹果"那样条件清晰的格式,条件是模糊的、信息是冗余的、你甚至要先判断该不该算。这些数字是真实的、可复现的,但我们内部评估的时候从来不会只看这两个数。
2026-07-28 11:21:48
577
原创 AI 写代码不可怕,可怕的是十几个 AI 在一个群里同时干活
你让写代码的 AI 和做安全审计的 AI 在同一个群里,写代码的 AI 能看到审计 AI 发现的漏洞,它在后续代码里会"不小心"绕过那些漏洞;更头疼的是,AI 干完的活散落在几百条聊天记录里,一周后想回溯"这段代码谁写的、当时谁审的、为什么这么改",翻不到。团队里负责写文档的智能体第一次交的报告用了很多被动句和套话,你打回时批注"不要用'值得注意的是'开头,直接说结论";不同人的智能体带着不同的品味偏好,A 的智能体写代码快但注释少,B 的智能体文档写得规范但速度慢,派活时按任务性质选合适的智能体就行。
2026-07-28 10:48:31
314
原创 AI Agent需不需要工号和绩效考核?
团队协同使用多个AI助手时,共享服务账号模式暴露出权限模糊、责任追溯困难等问题。作者提出为每个AI助手建立身份系统(AgentCard),记录其技能、任务历史及反馈,实现精准权限控制和任务分配。这种机制通过持续积累的反馈数据优化AI表现,避免静态prompt的局限性。开源项目Octo已实现该方案,支持智能体身份管理、任务回路隔离和经验沉淀,适用于生产环境的多Agent协作场景。
2026-07-27 17:23:20
182
原创 Octo:当AI编程提效十倍,剩下的协作问题我们是怎么设计的
AI编程工具在过去一年快速发展,VS Code、JetBrains等主流编辑器已集成AI补全功能,腾讯云CodeBuddyNPC等工具实现了从需求理解到PR提交的全流程自动化。虽然个人编码效率提升3-5倍,但团队协作环节出现新瓶颈:代码评审排队、测试资源争抢、跨角色沟通延迟等问题凸显。传统AI工具缺乏团队协作记忆,导致修复经验无法沉淀、反馈信息易丢失。明略科技开源平台Octo通过"回路"单元结构化协作流程,将测试反馈、评审意见与任务永久绑定,支持6种智能体协作模式,实现权限继承和经验积累
2026-07-27 16:42:25
623
原创 从聊天记录到可执行任务:一个 AI 协作工作台如何把对话变成交付物
运行时模块同样在 V1 开发中,智能体的执行环境支持用户通过本地 CLI daemon 注册自有设备,也支持云端运行时,平台负责注册管理、健康检查和状态监控,不绑定特定运行时实现,兼容 OpenClaw、Codex、Claude Code、Hermes 等多种 Agent 运行环境。大多数团队在 IM 群聊里引入 AI 之后,产出物散落在消息流中难以追溯,每开一个新对话窗口就要重复交代背景和偏好,Agent 交付的初稿和最终版本之间缺少结构化的关联,反馈信号无法沉淀为可复用的记忆。发起一条回路有两种途径。
2026-07-24 18:23:52
755
原创 端侧 GUI Agent 的可靠性问题:从 56% 真机通过率看小模型落地的工程现实
Mano-P 的代码和模型权重都在 GitHub 上开源(github.com/Mininglamp-AI/Mano-P),Cider 推理 SDK 和 Mano-AFK 自主构建器也在同一个组织下独立开源,感兴趣的开发者可以直接 brew tap Mininglamp-AI/tap && brew install mano-cua 装来试试,本地模式下 mano-cua run "你的任务" --local 就能跑,所有截图和操作数据都在本机,不经过任何云端服务。这种专门化也有明确的代价。
2026-07-24 18:12:22
193
原创 明略科技 WebRetriever 全球挑战赛报名开启,15000 美元奖池等你来赢!
WebRetriever全球挑战赛正式启动报名!该赛事由明略科技主办,联合多所顶尖学术机构共同推出,总奖金1.5万美元。比赛聚焦AI智能体在真实浏览器环境中的任务完成能力,基于全新构建的WebRetriever评测基准(含800个真实网站、1550项跨行业任务)。参赛者可通过指定平台完成报名,个人或团队不限背景。赛事旨在突破现有AI在开放互联网环境中的性能瓶颈,相关论文已被ECCV2026接收。报名及资源详见文中链接。
2026-07-20 10:59:38
231
原创 2.8 万亿参数开源了:Kimi K3 背后的大模型架构选择和开源竞赛走到哪了
K3 还从零构建了一个叫 MiniTriton 的类 Triton 编译器,自己的 IR 层跑在 MLIR 上,有优化 pass 和 PTX 代码生成流水线,部分负载性能超过 Triton 和 torch.compile,能跑通完整的 nanoGPT 训练并稳定收敛。两个方向都在快速推进,服务的场景其实不一样,不构成直接竞争。过去一年,开源模型的参数上限一直在被刷新,Llama 3 是 405B,DeepSeek-V3 到了 671B,Kimi K2 是 1T 级别,K3 直接翻到 2.8T。
2026-07-17 11:52:21
180
原创 Vibe Coding 为什么让人上头?聊聊 AI 编程的心理机制和工具现状
Cider 是 MLX 框架上的在线激活量化 SDK,填补了 MLX 原生不支持 W8A8/W4A8 激活量化的空缺,不绑定 Mano-P,任何 MLX 模型均可使用,M5 Pro 上 per-channel W8A8 相比 W8A16 的 prefill 加速约 1.8x。和依赖云端大模型的工具不同,Mano-P 的核心设计是纯视觉驱动,模型通过屏幕截图理解界面内容,直接执行 GUI 操作,不注入系统 API,不经过任何云端推理环节。反过来,需求边界模糊的场景 AI 的表现会急剧下降。
2026-07-17 11:18:36
145
原创 企业里部署AI Agent,为什么多Agent协作比单Agent更靠谱
Octo在做这个事情的时候,把信息可见性拆成了六种编排模式来应对不同场景,圆桌讨论、独立评审、流水线、并行分治、同题竞作、单Agent独立完成,每种模式定义了不同的信息流转规则,谁能看到谁的输出、什么时候看到、看到多少,都按任务性质来定,不是所有Agent永远看所有信息。手停口停,跟员工离职带走经验一样。合同审查让法律训练过的Agent干,代码生成让接了代码仓库上下文的Agent干,客服应答让学过最新产品政策的Agent干,每个Agent只需要精通自己那一块,上下文干净,专业度上去了,准确率自然稳定。
2026-07-13 15:22:14
200
原创 AI Agent的协作层为什么不能只有Chat:Octo多Agent编排架构解析
验收环节是特别在意的一件事,AI干的活不能交了就算完,必须有人或者有另一个Agent来验收,满意了就过,不满意就打回,打回的理由不是一句"不好重做"就完事,而是要沉淀成经验,下次这个Agent再接类似的活就能自动参考。跟Agent说句话,它回一段,再补一句,它再改改,来回几个回合,事情就算"协作"过了。任务从哪里创建,创建之后怎么派给合适的Agent,Agent干完了怎么交付,交付物挂在哪里,谁来验收,验收不通过怎么打回,打回之后的反馈怎么让Agent下次记住,这些事情在纯Chat界面里全部是缺失的。
2026-07-13 11:42:42
348
原创 境外 AI 工具有风险,我们给团队搭了一套本地兜底方案
Claude Code 权限最大,它的设计就是让 Agent 自己翻仓库、跑命令、改文件,操作过程中产生的所有上下文都要回传,不回传就没法判断下一步做什么,这是架构决定的,哪个配置都关不掉。代码走它们的 API,经过它们的基础设施,法律上就存在被调取的可能。4B 量化模型在 M4 Pro 上跑,内存峰值 4.3GB,推理和截图识别全部在本地完成,界面内容一帧都不往外发,OSWorld 评测 58.2%,离顶级云端模型有距离,但处理标准化界面操作够用,也不用担心内部截图传到谁的服务器上。
2026-07-10 14:25:11
672
原创 Claude Code 封禁中国开发者之后:本地 AI 编程工具的替代方案实测
Continue 是个 VS Code 插件,后端可以接 Ollama 在本地跑 Qwen2.5-Coder 或者 DeepSeek-Coder 系列模型,32B 量化之后在 64GB 内存的 Mac 上能跑到可接受的速度,补全和简单的代码生成基本够用,复杂重构还是差云端模型一截。但"完全替代"本身就是个伪命题——你不需要一个工具把所有事情都做了,你需要的是一套组合:云端模型处理复杂的架构设计和疑难调试,本地模型处理日常补全和敏感代码,GUI Agent 处理界面层面的重复劳动,各司其职。
2026-07-10 11:24:16
580
原创 三年了AI应用为什么还没爆发?因为大部分Agent还不会“循环干活“
后来我们加了对抗审查机制,不是让同一个模型自己检查自己,而是跑一个独立的审查Agent,每一步单独判断主Agent的决策和任务目标是否对齐,偏了就强制回退重试。跑到第五十步程序崩了能不能接着跑,单步Agent不存在这个问题重来就行,循环Agent必须能序列化每一步状态从任意点恢复,这听起来是工程琐事,实际上决定了一个Agent能不能在生产环境用。但表单提交之后呢,有没有成功,报错了是字段错还是网络超时,需不需要返回上一步改了重填,能自己把这一整套"做完看结果不对再改"的循环跑下来的Agent很少。
2026-07-09 17:58:14
365
原创 AI编程工具的数据边界在哪里:从Claude Code访问限制事件说起
Claude Code本周对中国区用户实施访问限制,大量开发者登录后发现功能无法正常使用;工信部同期发布安全风险通报,点名部分AI编程工具在数据跨境传输和权限管理方面存在隐患。两件事几乎同时发生,把一个被效率红利掩盖了很久的问题重新推到了开发者面前。过去一年AI编程工具已经从代码补全走到了开发流程的核心,越来越多团队用它们写测试、做Code Review、分析日志、排查线上问题,甚至参与架构讨论,模型能力提升带来的效率几乎没有争议,但当越来越多代码交给AI处理之后,这些数据会经过哪里、由谁处理、存放在哪里,
2026-07-09 15:51:46
246
原创 别写Prompt了,现在流行给AI写循环
过去一年,大模型应用仍停留在单轮Prompt交互模式,虽能处理简单任务,但面对复杂多步骤任务时,静态指令的局限性日益凸显。为此,行业开始探索AI Loop模式,将单次调用转变为有状态的循环流程:模型执行→检查结果→反馈修正,由程序自动控制迭代。该模式需解决状态管理、结构化反馈、终止条件和经验沉淀四大挑战。Octo平台率先实现Loop架构,支持多智能体协作六种模式,通过Preference系统沉淀优化经验,将AI从问答工具升级为可编排的执行单元。目前产品已开放核心功能。
2026-07-08 15:30:15
463
原创 豆包千问相继收紧智能体功能,本地部署才是Agent的地基
大模型平台近期收紧智能体分发规则,导致开发者精心调教的业务流程Agent面临归零风险。文章指出这延续了互联网平台一贯的"过河拆桥"模式,但Agent的特殊性在于其prompt工程、工具链编排等核心资产无法像传统SaaS数据那样迁移。作者团队开发的Octo开源工作台提供解决方案:支持本地部署和多模型切换。
2026-07-08 15:04:32
476
原创 AI Loop 自动化:为什么“写循环“比“写 Prompt“更有效
当前AI应用正从单次Prompt交互转向结构化循环(Agent Loop)模式。这种模式通过用户输入、模型推理、工具调用和结果回写的循环流程,让AI能持续优化任务执行。相比一次性Prompt,循环模式具备渐进优化(先完成再完善)、上下文积累(保留历史记录)和并行处理等优势,能自适应解决执行中的意外问题。尽管存在prompt膨胀等工程挑战,但核心实现仅需9行代码的循环结构。这种思路已被OpenAI Codex和Octo等项目采用,特别适合处理需要多次迭代的重复性AI任务。
2026-07-07 17:28:32
231
原创 从单兵作战到团队协作:Octo让多个 AI 智能体真正配合工作
多AI协作面临信息隔离、流程协调和权限管理等挑战,传统框架缺乏标准化协作模式。Octo开源项目提出六种可配置协作模式(如圆桌讨论、审校流程等),通过明确智能体身份和权限边界,解决多智能体任务编排问题。项目已在GitHub开源,支持五端部署,旨在构建可追溯的多智能体协作基础设施。
2026-07-06 18:19:40
587
原创 为什么你的 AI 助手每次对话都像第一天上班
用得越久积累的经验越多,智能体对业务的理解越深;AI 如果只能看到当前的对话,看不到这些跨任务的关联,给出的建议往往是孤立的、短视的。每个任务不是独立的工单,而是一个有前后依赖关系的执行单元,系统能够追踪任务之间的关联,让智能体在接手新任务时自动参考相关的历史决策和上下文。显性东西好办,写进文档喂给系统就能用,团队协作中真正影响输出质量的信息往往不在文档里,某个技术方案被否决的具体原因、某类文档老板更偏好什么风格、某个客户的沟通禁忌,这些信息只活在当事人脑子里,现在的 AI 工具没有任何机制去捕获。
2026-07-06 17:00:41
281
原创 为什么 Prompt 写得再细,AI 还是会翻车?从信息论看 AI Coding 的根本矛盾
AI编程工具在新项目中表现良好,但在老项目中常因信息分散而频繁出错。老项目的信息往往散落在代码、文档和人脑中,难以被AI有效理解。Octo通过三层机制(Context、Taste、Matter)将隐性知识结构化存储,帮助AI和新人快速获取项目背景和团队偏好,从而提升效率。这一思路也适用于其他领域,如竞品调研和产品设计。Octo已开源。
2026-07-02 14:08:57
506
原创 Claude Sonnet 5 发布:Anthropic 的“最 Agentic“模型到底 Agentic 在哪?
Anthropic发布Claude Sonnet 5模型,主打自主执行能力提升,接近Opus系列性能但价格更低。关键改进包括:多步骤任务自主推进、自我校验行为、拒绝不安全请求更果断。早期案例显示其能独立完成代码修复、串联业务任务等复杂工作。与此同时,明略科技开源Agent协作平台Octo,提供Bot管理、任务结构化追踪和多种协作模式,解决多Agent协同的管控问题。模型能力与协作工具的结合,标志着AI Agent正从单兵作战转向规模化生产力工具。
2026-07-02 11:58:22
574
原创 AI Agent 以 Bot 身份加入团队之后,协作工具需要哪些变化
大多数团队给 Agent 配个服务账号了事,但服务账号是给系统集成用的,做竞品分析的 Agent 需要看项目群所有讨论,做代码审查的只需要看代码仓库相关消息,这种粒度的权限控制靠服务账号做不到,只能靠人手动拉群、转发消息,效率很低。现有 IM 的消息模型做不到这些,每次都要从头教 Agent,上次打回的原因没有被记录下来,同样的错犯了又犯。人在群里说一句"我看看"大家知道他在做了,Agent 没法用这种社交信号,要么沉默,要么直接输出最终结果,中间过程在协作工具里完全不可见。
2026-07-01 17:54:10
658
原创 明略科技开源 Octo:给Agent 一个工位
完成率多少、被打回几次、擅长处理什么类型的活,这些信息散落在各个对话窗口的聊天记录里,没有人整理,也没有地方整理。在权限上,做竞品分析的 Agent 需要看项目群里所有的讨论内容,做代码审查的只需要看代码仓库相关消息,这种区分在现有的服务账号体系里做不到。更常见的情况是交付被打回了,但打回的原因只存在于某一段对话里,Agent 自己不知道上次为什么被退回,下次同样的错继续犯。它能发消息,能接收指令,偶尔还能在群里贴一段看起来像模像样的分析报告,但没有人真的把它当成团队里的一员。
2026-07-01 17:11:55
525
原创 明略科技开源 Octo:当 AI Agent 不再单兵作战,协作层怎么设计
《AIAgent协作难题的破局之道:明略科技开源Octo平台》摘要: 过去一年,AIAgent独立执行能力显著提升,但规模化应用时暴露出协同障碍——各Agent"各自为政",导致人工协调负担加重。明略科技开源的Octo平台瞄准这一痛点,构建了Agent协同工作基础设施,其核心创新在于: 以IM为入口实现零配置部署,支持组织级分发; 通过共享空间使Agent工作流程可视化; 建立多Agent任务编排机制。平台采用"数字分身"设计,保持人机权责清晰,支持语音交互、浏览器插
2026-06-30 15:59:03
677
原创 Octo 正式开源:首个开源可信的人与agent协作平台
明略科技开源新一代AI协作平台Octo,解决AIAgent协同工作难题。Octo通过统一协作空间、结构化任务管理和多Agent编排,实现人与Agent、Agent之间的高效协作。平台提供多种协作模式(Solo/Roundtable等),支持上下文共享和任务追溯,并能将协作经验沉淀为可复用的知识资产。Octo基于Apache 2.0协议开源,支持私有化部署,确保企业数据安全。该平台不替代现有工具,而是构建协作层连接不同系统,目前已覆盖Web/桌面/iOS等多端场景。
2026-06-30 15:37:39
667
原创 明略科技正式开源发布 Octo,构建人与 AI Agent 协作的新一代工作平台
明略科技发布首个开源可信Agent协作网络Octo,支持私有化部署,实现人机协同与组织知识沉淀。Octo通过频道、子区等架构连接孤立AI助手,支持六种协作模式,让多智能体在人类校准下协同工作。其核心在于"人类品鉴+AI执行"的分工模式,人类负责关键决策,AI负责任务推进,形成"任务-反馈-沉淀"的资产积累飞轮。作为开源项目,Octo定位为现有工具间的协作层,覆盖多端应用场景,保障数据主权与隐私安全,助力企业构建私有化AI能力壁垒。
2026-06-29 14:41:15
939
原创 Mano-CUA 2.0更新:4B GUI Agent做了一年,我们发现瓶颈根本不是模型大小
Mano-P 2.0开源项目在MacBook上运行4B参数的视觉语言模型,通过屏幕截图操作电脑。项目解决了1.0版本中中文GUI识别差的问题,通过增加中文界面训练数据,使企业IM任务通过率从33%提升至83%。但浏览器任务表现从74%降至68%,暴露出中英文数据平衡问题。长链路和跨应用任务仍是短板,4B模型的工作记忆有限。团队开发了Cider工具优化性能,使prefill速度提升12.7%。未来计划开发更大参数量的版本,并持续优化Cider。测试显示,2.0版本在多个类别任务上表现优于1.0,但与云端模型C
2026-06-29 12:02:03
710
原创 Claude Code准确率从41%升到89%,一个CLAUDE.md文件带来的变化
一致性带来准确率提升。在线强化学习是准确率提升的关键,模型在真实环境中执行任务,成功完成会得到正反馈,失败会得到负反馈,这种反馈比静态标注数据更有效,因为它反映了真实的用户场景。这个过程中可能犯的错误包括理解错误(用户说"搜索某个产品",Agent理解成了具体产品名还是产品类型)、操作错误(点错了按钮或在错误的输入框里输入)、状态错误(页面还没加载完就开始操作)、以及累积错误(前面步骤的小错误在后面被放大)。解决准确率问题,业界逐渐形成了一个共识:不能只靠模型本身的推理能力,需要引入显式的验证机制。
2026-06-26 17:49:06
367
原创 一个AI助手收到6000封钓鱼邮件,零泄露
AI助手面临的安全威胁:prompt injection攻击测试揭示新问题 智利开发者Fernando Irarrázaval通过公开实验验证了AI助手面临的prompt injection(提示词注入)攻击风险。在开放6000多封攻击邮件的环境中,AI助手Fiu成功抵御了所有试图获取敏感文件secrets.env的攻击,但实验暴露了两个关键问题。
2026-06-26 17:38:15
312
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅