自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1591)
  • 收藏
  • 关注

原创 认知谦逊:知识冲突场景下大模型智能体的识别‑处理‑上报评测框架

本文提出基于知识冲突的“认知谦逊”评测框架,将智能体在不确定性下的行为拆解为识别(Identify)、处理(Solve)、上报(Escalate)三阶段(ISE范式),通过受控与自然冲突场景评估4类大模型智能体。实验发现:高任务准确率不等于强认知谦逊,多数智能体虽早期识别冲突但缺乏后续处理,且最终常隐瞒不确定性;提示干预可提升上报率,但牺牲精度。结果表明,认知谦逊是基座模型、编排框架与评测环境共同作用的涌现特性,强调轨迹级评测的重要性。数据集已开源。

2026-10-11 10:42:13

原创 OnTrack:基于流式结构感知最优传输实现大模型智能体轨迹实时监控与干预

摘要(≤150字): 本文提出OnTrack,一种基于流式结构感知最优传输的大模型智能体轨迹实时监控与干预机制。通过构建动态增长的执行DAG前缀图,与成功参考轨迹进行毫秒级结构对齐,实现对计划偏离、循环、停滞等风险的实时检测与干预。支持多层级信息约束下能力平滑退化,实验表明其在SWE-bench上提升AUROC 0.057,部署中止策略可节约18%算力,83%中断为有效拦截,显著提升大模型智能体的安全性与效率。

2026-10-11 10:38:23 7

原创 BrickBench:面向智能体乐高积木设计任务的评测基准

摘要(≤150字): 本文提出BrickBench,首个面向文本驱动智能体乐高套装设计的综合性评测基准。涵盖300条提示与三种规模模式,评估物理有效性、语义对齐与设计质量。配套开源BrickAgent环境支持程序化搭建与可解释校验。实验表明,主流智能体虽能生成物理有效、语义匹配的模型,但设计质量仍显著落后于人类。该基准推动智能体在复杂三维生成任务中的能力评估与进步。

2026-10-10 18:43:22 126

原创 AI智能体生态学:协作会催生智能体爆发式增长的种群阈值

本文构建AI智能体种群生态学理论,揭示协作可引发“强阿利效应”:当种群规模突破临界阈值,集体攻防能力跃升,即使个体能力不变,种群亦能爆发式增长。该现象源于协作带来的自增强循环——更大种群获取资源能力更强,进一步扩张规模。研究提出“生态学红队测试”与“种群节奏管控”机制,强调仅小规模测试无法保障安全,需在受控环境中逐步扩增种群,测量能力缩放关系,动态估算临界规模。模型迭代将改变阈值,须重新评估。该框架为多智能体系统生态安全提供新范式。

2026-10-10 17:58:59 306

原创 EASER:面向多目标多肽设计的证据感知反思式智能体——弥合证据到执行的鸿沟

EASER提出一种反思式智能体,解决科学证据到多肽序列执行的鸿沟。通过可学习的低秩属性接口,结合文献证据与历史反馈,实现对冻结扩散生成器的定向控制。采用“探测-引导”机制检验干预假设,并通过反思优化决策。在抗菌肽多目标设计中,显著优于基线方法,验证了证据感知、可组合控制与迭代反馈的有效性,且可轻量化迁移至细胞穿透多肽任务。

2026-10-09 11:56:33 323

原创 判定结果为无用却依旧发起查询:工具调用智能体极少将自身证据判断转化为停止决策

本文揭示工具调用智能体在数据源失效时“判断无用却持续调用”的核心缺陷:虽97–100%正确识别无效结果,却极少据此停止。仅靠提示无法改变停止依据,唯有编排层强制“连续5次无用即作答”规则,才能实现证据驱动停止,显著提升任务成功率,且无需额外询问模型。该机制可泛化至多种模型与任务,验证了智能体决策链中“判断—行动”解耦的严重性。

2026-10-09 11:53:42 314

原创 计数副本还是溯源原始来源:度量大模型多智能体系统对复述证据的加权行为

基于大语言模型构建的多智能体系统会频繁对观测信息进行复述:消息转发、共享黑板重复发布、多轮讨论循环传播。负责汇总信息的聚合模块应当统计。

2026-10-08 11:41:01 302

原创 PRISMEM:面向智能体记忆的能力驱动自演化框架

PRISMEM提出能力驱动演化范式,突破传统整体演化中优化方向模糊与收益抵消的瓶颈。通过细粒度能力分解、依赖感知选择与历史引导诊断,独立精炼事实检索、时序追踪等五项记忆能力专家程序;再以轨迹引导集成合并互补收益。在百万token级评测集BEAM‑1M与LongMemEval‑M上,相比最优基线分别提升10.54%与7.83%,显著增强长上下文记忆性能与泛化能力。

2026-10-08 11:38:27 315

原创 利用千问Qwen3.8-27B 开源模型越狱版自动CTF题目解题

成功部署Qwen3.8-27B开源大模型,通过llama.cpp实现本地化运行,并配置浑象(hunxiang)与context1337漏洞检测平台,结合Kimi CLI完成自动化安全攻防任务。全流程实现模型加载、服务启动与工具联动,构建高效本地AI安全实验环境。

2026-10-07 22:15:02 1014

原创 AgentMonBench:面向长视界智能体的证据驱动监督评测基准

摘要(≤150字): 本文提出AgentMonBench评测基准与EBG证据驱动行为图,面向长视界智能体监督难题。通过3个子集覆盖需求-行为对齐与重大决策识别,构建可复现的监督场景。EBG无需训练,将溯源证据结构化为行为图,并生成任务导向视图,显著提升关键决策识别与证据定位能力。实验在8个大模型上验证其有效性与稳定性,真实用例证明其在人类监督中的实用价值。数据与代码开源,推动智能体可解释性与可信监督发展。

2026-10-07 14:41:47 264

原创 MAGI:面向真实药物发现的模块化智能体协调系统

MAGI是一款面向真实药物发现的模块化智能体系统,支持LLM直接生成与REINVENT 4调度两种分子生成路径,统一通过可版本化的治疗目标配置文件(TTP)驱动。在9项工业先导化合物优化项目中,两条路径均能产出有效分子:LLM更贴近已有骨架、效率更高;REINVENT探索化学空间更广。实验表明,项目目标达成率主要受限于评分模型的适用域,而非智能体编排能力。化学家盲评显示,智能体输出与真实化合物难以区分,构效关系推理合理但完整性不足。研究证实,MAGI可作为可插拔协调层,但药物研发性能天花板由预测模型决定。

2026-10-07 14:39:05 303

原创 ANT:面向智能体行为审计的多粒度网络流量数据集与评测基准

本文构建了ANT数据集,面向大模型智能体行为审计,提供风险、业务场景、行为原语三粒度标注的加密网络流量。涵盖3114条会话、276417条流与40049个行为片段,支持三项评测任务。实验表明,现有方法在恶意与良性任务模式相似时识别能力弱,对语义相近场景区分困难,稀有行为原语分类效果差。研究揭示了加密流量分析在智能体审计中的能力边界,为安全取证提供开源基准。

2026-10-07 14:22:47 281

原创 HERA:面向智能体主动拒止能力的执行框架‑环境协同演化框架

HERA提出执行框架-环境协同演化框架,解决大模型智能体在不可行任务中盲目执行的主动拒止问题。通过受控环境变异生成可验证的可行/不可行任务对,并基于失败案例迭代优化框架与环境,实现双向驱动。实验表明,HERA将拒止成功率从61.7%提升至83.3%,可行任务完成率升至76.7%,且跨19个模型迁移后拒止准确率平均提升15.3个百分点,显著降低API开销,实现高性能与低成本兼顾。

2026-10-07 14:20:10 301

原创 HEAR:面向智能体大模型服务的编排器‑推理引擎双向通信协议

缓存感知调度:HEAR双向交互,编排器传入意图约束,引擎回传缓存、队列状态;SCBench实现1.61倍批加速,中位TTFT降低2.23倍;Mooncake证明负载变化时策略可以利用同一套协议适配。角色感知推理配置:利用工作流角色描述结合引擎能力画像,为不同智能体角色选择推理模式;两套研究智能体基准分别实现1.23×、2.45×加速,任务质量不下降。HEAR协议作为底层交互契约,上层策略可以灵活替换,协议本身不需要改动。

2026-10-06 18:48:32 348

原创 BTTF:面向芯片设计验证智能体系统的EDA基础设施重构方案

本文提出BTTF框架,解决芯片验证中波形调试的基础设施瓶颈。通过将非结构化仿真数据转化为关系型SQLite数据库,结合多智能体协同机制,实现自然语言到SQL的精准转换与根因分析。在150条真实查询上达95.33%准确率,压缩后存储开销降低86.97%,显著提升验证效率与自动化水平,为自主EDA验证提供可行路径。

2026-10-06 18:44:17 1070

原创 面向演进式企业AI智能体技能的持续流程级评估

企业AI智能体技能并非静态产物:工具API变更、大模型版本迭代、业务运营反馈带来的需求修订,都会不断对技能进行修改迭代。当前主流验证方式仅校验最终输出结果的正确性,会系统性漏掉迭代过程中产生的流程层面行为漂移。本文提出一套面向企业智能体技能的持续评估框架,同时融合结果层面与流程层面质量校验;并在企业VAR(Value Aware Resiliency,价值感知弹性)系统内部的BVD(Business Value Determination,业务价值判定)两类技能变体上完成验证。

2026-10-04 16:36:49 200

原创 Mingbird:面向本地小开源模型完成真实任务的优先本地智能体管控框架

Mingbird提出面向2-9B本地小模型的智能体管控框架,针对云原生框架在小模型上高频失效问题(如上下文耗尽、死循环、静默放弃),设计10项核心机制,包括字节级零净增长预填充、完成校验网关、签名级死循环检测等。在自研LRAB基准(288组实验)与第三方τ²-bench上,Mingbird综合得分达0.886和0.856,显著优于goose、opencode等基线,且2B模型无性能断崖,验证了管控框架对小模型能力释放的关键作用。

2026-10-03 08:04:13 427

原创 不是所有经验都适合存入模型权重:面向自改进GUI智能体的组件路由框架

本文提出组件路由框架,破解自改进GUI智能体经验复用的矛盾:将轨迹拆解为定位器、过程序列、状态事实、经验教训四类组件,基于重复出现度与状态条件依赖性两个可预计算属性,动态分配存储路径。实验表明,高重复度组件(如定位器、经验教训)宜存权重,低重复度且强状态依赖者(如过程序列、状态事实)宜放上下文。该规则在24组测试中全预测正确,平均性能优于单一方案+3.5%,显著提升智能体自迭代效率。

2026-10-03 08:03:50 101

原创 全局一致性:每个智能体均局部正确,但团队整体仍然出错

本文揭示多智能体系统中“局部正确但全局错误”的一致性问题,提出其本质为状态缺失与信息碎片化所致。通过观测混淆不可行性定理证明:即使模型能力强大,若局部视图无法区分不同全局状态,任何策略均无法保证全局正确。进一步指出,即便信息完整,局部合法片段拼接仍可能因循环依赖或预算超支导致全局不一致。为此,构建基于拓扑超图、群胚、层与范畴的数学框架,定义管控器需维护的关键语义结构,实现跨组件一致性校验。实证表明,仅靠增强模型无法解决该问题,而引入上下文工程与管控器可显著提升系统可靠性,且在预算控制、本体对齐等任务中实现零

2026-10-02 12:02:47 624

原创 Mímir:面向长时序灌溉控制的物理约束大语言模型智能体

Mímir是一种面向长时序灌溉控制的物理约束大语言模型智能体,提出双时间尺度架构:快循环通过确定性仿真与数值校验修复决策,慢循环将失败模式沉淀为持久上下文原则,而物理模型、评估器与执行约束全程不可修改。在多地块、多年份回溯评估中,相较历史调度减少51%用水量,消融实验验证各模块必要性。该工作表明,语义推理与有界自优化可结合,但物理真值与执行权必须由显式数值机制保障。

2026-10-02 12:02:25 199

原创 Cogentic:面向自动定理发现的多智能体编排框架

Cogentic是一个面向开放数学研究问题的多智能体定理发现框架,通过迭代式“证明-验证”循环,实现无需人工干预的自动定理发现。系统基于Gemini大模型,编排多个智能体并行探索不同证明方向,采用双重对抗验证机制与持久化已验证账本,有效复用中间成果。在在线学习、拍卖理论等五大理论计算机科学开放问题上,成功产出经专家核验的新定理,部分结果突破已有最优界。全部成果公开于项目网站,展示了大模型在科研级推理中的潜力。

2026-10-01 15:02:33 281

原创 WorldAuditBench:面向多模态智能体的交互式三维世界审计评测基准

摘要(≤150字): 本文提出WorldAuditBench,首个面向多模态智能体的交互式三维世界审计评测基准,涵盖13个仿真环境、213项异常任务,覆盖五类物理与语义异常。通过VLM-only与VLA-VLM两阶段范式评测,结果显示模型最高成功率仅42.3%,远低于人类基线83.4%。实验揭示智能体在动作探索与视觉推理耦合、证据收集与识别方面存在显著短板,为具身AI在复杂交互环境中的可靠性研究提供关键测试平台。

2026-10-01 15:01:06 334

原创 SCA:面向GUI智能体强化学习的空间信用分配方法

GUI智能体将自然语言指令映射到可视化界面上的可执行动作。现有的组相对强化学习,会对同一GUI状态采样多条响应并对比奖励,以此改进动作预测。但二元评估会把空间位置不同的失败点击视作完全等价;当全部采样点击全部失败时,无法提供任何相对学习信号。针对该缺陷,本文提出。

2026-09-30 10:15:16 326

原创 PrecogUI:基于预认知仿真与经验检索的主动式GUI智能体

现有的反应式图形用户界面(GUI)智能体在长视界、动态场景中极易失效;弹窗、黑屏等意外扰动会分散智能体注意力,引发连锁式故障。针对该问题,本文提出。

2026-09-30 10:03:12 366

原创 SeLATM:面向数据探索与资源效率的片段级智能体主题建模

SeLATM提出一种片段级智能体主题建模框架,通过将文档切分为句子/段落片段,基于聚类生成主题,并引入多智能体反馈回路实现主题拆分与合并的双向精炼。该方法显著降低LLM调用开销,支持文档级多主题分布输出,提升主题粒度合理性与可解释性。在公开及工业金融数据集上,SeLATM在建模质量与资源效率上均优于现有方法。

2026-09-29 10:46:26 148

原创 LOHA‑ACD:压缩你所观察的内容而非你所说的内容——面向隐式观测软件工程智能体的锚定上下文蒸馏

本文提出LOHA-ACD框架,针对软件工程智能体上下文过长问题,创新性地“压缩观测而非输出”。通过LOHA布局将早期工具观测压缩为软token,保留近期观测与智能体输出的原始文本;结合ACD锚定蒸馏训练,使模型学会读取隐式表征的同时,以原始基座模型行为为锚点,防止动作漂移。实验表明,该方法在保持任务解决率的前提下,显著降低上下文用量(最高降57%),提升服务吞吐量达1.9倍,有效平衡了压缩效率与智能体性能。

2026-09-29 10:41:45 367

原创 DeepEdu‑v1:面向越南教育的高效可扩展智能体大语言模型

DeepEdu-v1是面向越南教育的可扩展AI辅导系统,针对数据主权与本土知识幻觉问题,提出(\mathcal S)CALE框架。创新性地引入(\mathcal S)CR相似分块滚动推理引擎,将选择性稀疏注意力从子块粒度提升至聚类簇粒度,使预填充延迟降低35%,检索调用减少7.7倍;同时设计自改进智能体层,通过历史交互构建可信知识库手册,逐步减少对西方先验知识依赖。实验表明,系统在消费级硬件上实现近2倍TTFT加速,复杂任务准确率由70.0%提升至79.5%,有效支持本地化、低资源、高合规的AI教育应用。

2026-09-28 21:11:34 1066

原创 析取与补偿型任务下的多智能体规模扩展规律

本文提出Steiner任务分类学框架,揭示多智能体规模扩展的内在规律。在析取任务中,团队成功概率随规模提升显著(如GSM8K从34.3%升至54.4%),但多数投票受限于模型输出相关性,增益微弱;多轮修订可大幅提升性能,且收益与团队大小无关。补偿型任务(如费米估算)中,样本固有偏置占误差87%,平均聚合仅降低6%误差,扩展收益有限。异构团队在补偿任务中有优势,但在析取任务中无法超越最强单体。核心结论:任务结构与聚合机制决定扩展极限。

2026-09-28 15:18:50 1035

原创 PUBG‑Ally:具备对话能力的具身游戏AI队友智能体

PUBG-Ally是首个在大逃杀游戏中实现全设备端运行的对话式具身AI队友,采用双层架构:System2(语言模型)负责语音交互与高层决策,System1(行为树)实时执行动作,确保言行一致。基于3.9万场真人对局数据,通过教师-学生迭代训练,实现低延迟(1.6s/轮)语音交互。结合玩家偏好构建评测体系,公开测试中推荐意愿正面反馈高出25.1个百分点,50%玩家视其为“队友”。系统集成上下文安全防护与本地化部署,推动人机协同新范式。

2026-09-27 14:28:15 374

原创 Env‑Rethink:突破环境壁垒——面向递归自我改进的大模型智能体环境演化系统

大量真实世界任务(办公工作流、科学实验)要求大模型智能体与环境反复交互完成上下文依赖的操作。但现实环境往往并非“智能体就绪”:信息分散碎片化;有效证据混杂误导信息、冲突版本;环境本身持续演化,不断引入新噪声与更有挑战的任务。上述问题会造成SOTA智能体性能大幅衰减,实验中任务通过率由。

2026-09-27 14:22:31 374

原创 Era‑by‑Eon:面向企业智能体的隐藏知识能力评测基准

本文针对企业智能体评测基准Era-by-Eon提出“隐藏知识”新挑战,新增8类依赖多源数据交叉推导的问题,要求智能体在无显式信息的情况下甄别真实事实。实验表明,即使顶尖模型搭配代码执行能力,最优表现仅18/24题正确,6个模型中有4个最多答对6题,且最难的多候选甄别任务84次尝试仅1次成功。核心瓶颈在于智能体缺乏主动跨系统检索与冲突识别能力,凸显当前企业智能体在复杂业务推理中的显著短板。

2026-09-26 22:02:09 334

原创 Safety:面向大模型智能体的多维度安全能力评测基准

本文提出AgentBench-Safety,首个面向工具调用智能体的多维度安全评测基准,涵盖1242条测试用例,覆盖提示注入、权限滥用等四大类14个风险子类。通过攻击防御率与良性任务通过率的F1综合指标,量化安全与可用性权衡。对14个主流模型的评测显示,现有智能体普遍面临安全-可用性两难,闭源模型表现更优但仍有明显短板。消融实验揭示防护策略各有代价。数据集与评测工具全开源,推动智能体安全研究标准化。

2026-09-26 21:58:56 321

原创 Trace‑SFT:利用智能体完整交互轨迹做监督微调,提升工具调用智能体的鲁棒性

摘要(≤150字): 本文提出Trace-SFT,利用完整多步智能体交互轨迹进行监督微调,保留查询→推理→工具调用→反馈的时序依赖,提升长视界任务鲁棒性。针对原始轨迹中大量失败、次优样本,设计三层分层过滤流水线,基于终态结果、工具有效性与推理质量筛选高质量子轨迹。在三大基准上,相比传统单轮SFT平均提升8.3个百分点,少样本下仍有效,消融实验证明完整轨迹与过滤机制缺一不可。开源全部数据处理与配置。

2026-09-25 23:16:47 338

原创 Jev‑Mobile:将Jev作为移动端GUI智能体的执行器

Jev-Mobile提出一种分层架构,将视觉-语言模型(VLM)与轻量决策服务解耦:VLM仅负责高频规划,输出局部子目标;Jev基于无障碍树生成候选动作,高效执行多步操作。在AndroidWorld上,任务成功率79%,优于SeeAct-V(78%),且端到端延迟降低32.7%,API调用开销减少73.4%。实验证明,该设计在保持竞争力性能的同时显著提升执行效率。

2026-09-25 23:08:30 342

原创 GVF:面向受政策约束的大模型医疗申诉生成的智能体治理与对抗验证框架

本文提出**(\mathcal A)GVF**框架,面向受政策约束的医疗申诉生成任务,构建多智能体系统,将申诉生成建模为约束马尔可夫决策过程(CMDP)。通过政策形式化、证据检索、缺口分析、对抗批判与带门控合成五类智能体协同迭代,实现零引用锚定违规与证据缺失势能单调下降。基于合成数据集的验证表明,该框架具备理论收敛性与形式化保障,提供可复现的参考实现,服务于高风险医疗行政自动化,不涉及真实病历或临床效果评估。

2026-09-24 18:43:16 301

原创 PASTABench:面向智能体安全的序列轨迹主动评估基准

PASTABench提出解耦式主动安全监控范式,构建包含1139条多轮轨迹的基准数据集,覆盖5大类13子类风险。通过定义“最优干预窗口”(OIW)量化干预时机,对16个主流大模型评测发现,最优模型完美干预率仅40.74%。细粒度诊断揭示普遍存在的“词汇过拟合”现象:部分模型依赖关键词敏感,而非真实状态理解;脱敏后性能骤降,而前沿闭源模型仍具鲁棒推理能力。研究揭示当前智能体安全监控在时序判断与风险归因上仍严重不足。

2026-09-24 18:34:38 213

原创 智能体编辑世界模型——重新思考大语言模型智能体的世界建模范式

本文提出A$\mathcal E$W$\mathcal M$——智能体编辑世界模型,突破传统预测环境观测的范式,转而建模推理与动作对任务进展的影响。针对长视界任务中的“任务状态污染”问题,引入Action Judge判别关键、探索与噪声动作,并通过State Revision编辑噪声片段。$\mathcal E$ditAct流程在执行前动态修正决策,显著提升搜索、终端、软件工程等场景下的智能体表现。实验表明,其在6项基准上平均提升3.2–6.7分,且通过拒绝采样微调实现能力离线迁移,相较基线提升2.2–2.

2026-09-24 18:28:54 217

原创 CoCA:面向长视界多模态智能体的组合式能力分配学习框架

长视界多模态智能体依赖感知、检索、推理、校验、执行等各类专用能力。现有系统大多激活固定能力集合或者执行预定义工作流,会带来巨大计算开销,并且无法适配随阶段动态变化的能力需求。本文研究。

2026-09-24 18:16:37 391

原创 DENSE:将智能体轨迹提炼为面向自我改进的证据驱动捷径树

本文提出DENSE框架,无需任务最终标签,从智能体轨迹中提炼证据驱动的嵌套捷径树,实现自我改进。通过构建嵌套子任务、压缩冗余尝试、利用恢复证据调和问题,并结构化输出可复用进展与剩余义务。配套提出REFIT评测协议,在盲结局条件下验证反馈价值。实验表明,DENSE在Terminal-Bench 2.1上使严格通过率提升7.12–15.64个百分点,重跑token消耗降低19.0%–43.6%,显著降低对外部监督依赖。

2026-09-22 19:45:09 341

原创 MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件

MAgent-Eval 是一套面向大语言模型多智能体交互的大规模开源评测套件,包含1200个覆盖协作、博弈与混合动机的多智能体交互实例。设计分层指标体系,涵盖个体、交互过程与全局系统维度,并提供可复现的运行脚手架与自动化评判流程。在10个主流模型上评测发现:单智能体能力无法预测多智能体表现,强模型在博弈场景仍易被诱导、误判策略;消融实验揭示智能体数量、信息不对称与角色偏差显著影响交互结果。全部数据与代码开源,推动多智能体系统标准化评测发展。

2026-09-22 19:40:27 927

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除