<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[weixin_44626085的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/weixin_44626085</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; weixin_44626085]]></copyright><item><title><![CDATA[计数副本还是溯源原始来源：度量大模型多智能体系统对复述证据的加权行为]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167270103</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167270103</guid><author>weixin_44626085</author><pubDate>Thu, 08 Oct 2026 11:41:01 +0800</pubDate><description><![CDATA[基于大语言模型构建的多智能体系统会频繁对观测信息进行复述：消息转发、共享黑板重复发布、多轮讨论循环传播。负责汇总信息的聚合模块应当统计。]]></description><category></category></item><item><title><![CDATA[PRISMEM：面向智能体记忆的能力驱动自演化框架]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167270033</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167270033</guid><author>weixin_44626085</author><pubDate>Thu, 08 Oct 2026 11:38:27 +0800</pubDate><description><![CDATA[PRISMEM提出能力驱动演化范式，突破传统整体演化中优化方向模糊与收益抵消的瓶颈。通过细粒度能力分解、依赖感知选择与历史引导诊断，独立精炼事实检索、时序追踪等五项记忆能力专家程序；再以轨迹引导集成合并互补收益。在百万token级评测集BEAM‑1M与LongMemEval‑M上，相比最优基线分别提升10.54%与7.83%，显著增强长上下文记忆性能与泛化能力。]]></description><category></category></item><item><title><![CDATA[利用千问Qwen3.8-27B 开源模型越狱版自动CTF题目解题]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167225652</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167225652</guid><author>weixin_44626085</author><pubDate>Wed, 07 Oct 2026 22:15:02 +0800</pubDate><description><![CDATA[成功部署Qwen3.8-27B开源大模型，通过llama.cpp实现本地化运行，并配置浑象（hunxiang）与context1337漏洞检测平台，结合Kimi CLI完成自动化安全攻防任务。全流程实现模型加载、服务启动与工具联动，构建高效本地AI安全实验环境。]]></description><category></category></item><item><title><![CDATA[AgentMonBench：面向长视界智能体的证据驱动监督评测基准]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167221063</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167221063</guid><author>weixin_44626085</author><pubDate>Wed, 07 Oct 2026 14:41:47 +0800</pubDate><description><![CDATA[摘要（≤150字）： 本文提出AgentMonBench评测基准与EBG证据驱动行为图，面向长视界智能体监督难题。通过3个子集覆盖需求-行为对齐与重大决策识别，构建可复现的监督场景。EBG无需训练，将溯源证据结构化为行为图，并生成任务导向视图，显著提升关键决策识别与证据定位能力。实验在8个大模型上验证其有效性与稳定性，真实用例证明其在人类监督中的实用价值。数据与代码开源，推动智能体可解释性与可信监督发展。]]></description><category></category></item><item><title><![CDATA[MAGI：面向真实药物发现的模块化智能体协调系统]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167221012</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167221012</guid><author>weixin_44626085</author><pubDate>Wed, 07 Oct 2026 14:39:05 +0800</pubDate><description><![CDATA[MAGI是一款面向真实药物发现的模块化智能体系统，支持LLM直接生成与REINVENT 4调度两种分子生成路径，统一通过可版本化的治疗目标配置文件（TTP）驱动。在9项工业先导化合物优化项目中，两条路径均能产出有效分子：LLM更贴近已有骨架、效率更高；REINVENT探索化学空间更广。实验表明，项目目标达成率主要受限于评分模型的适用域，而非智能体编排能力。化学家盲评显示，智能体输出与真实化合物难以区分，构效关系推理合理但完整性不足。研究证实，MAGI可作为可插拔协调层，但药物研发性能天花板由预测模型决定。]]></description><category></category></item><item><title><![CDATA[ANT：面向智能体行为审计的多粒度网络流量数据集与评测基准]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167220817</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167220817</guid><author>weixin_44626085</author><pubDate>Wed, 07 Oct 2026 14:22:47 +0800</pubDate><description><![CDATA[本文构建了ANT数据集，面向大模型智能体行为审计，提供风险、业务场景、行为原语三粒度标注的加密网络流量。涵盖3114条会话、276417条流与40049个行为片段，支持三项评测任务。实验表明，现有方法在恶意与良性任务模式相似时识别能力弱，对语义相近场景区分困难，稀有行为原语分类效果差。研究揭示了加密流量分析在智能体审计中的能力边界，为安全取证提供开源基准。]]></description><category></category></item><item><title><![CDATA[HERA：面向智能体主动拒止能力的执行框架‑环境协同演化框架]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167220773</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167220773</guid><author>weixin_44626085</author><pubDate>Wed, 07 Oct 2026 14:20:10 +0800</pubDate><description><![CDATA[HERA提出执行框架-环境协同演化框架，解决大模型智能体在不可行任务中盲目执行的主动拒止问题。通过受控环境变异生成可验证的可行/不可行任务对，并基于失败案例迭代优化框架与环境，实现双向驱动。实验表明，HERA将拒止成功率从61.7%提升至83.3%，可行任务完成率升至76.7%，且跨19个模型迁移后拒止准确率平均提升15.3个百分点，显著降低API开销，实现高性能与低成本兼顾。]]></description><category></category></item><item><title><![CDATA[HEAR：面向智能体大模型服务的编排器‑推理引擎双向通信协议]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167176035</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167176035</guid><author>weixin_44626085</author><pubDate>Tue, 06 Oct 2026 18:48:32 +0800</pubDate><description><![CDATA[缓存感知调度：HEAR双向交互，编排器传入意图约束，引擎回传缓存、队列状态；SCBench实现1.61倍批加速，中位TTFT降低2.23倍；Mooncake证明负载变化时策略可以利用同一套协议适配。角色感知推理配置：利用工作流角色描述结合引擎能力画像，为不同智能体角色选择推理模式；两套研究智能体基准分别实现1.23×、2.45×加速，任务质量不下降。HEAR协议作为底层交互契约，上层策略可以灵活替换，协议本身不需要改动。]]></description><category></category></item><item><title><![CDATA[BTTF：面向芯片设计验证智能体系统的EDA基础设施重构方案]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/167176004</link><guid>https://blog.csdn.net/weixin_44626085/article/details/167176004</guid><author>weixin_44626085</author><pubDate>Tue, 06 Oct 2026 18:44:17 +0800</pubDate><description><![CDATA[本文提出BTTF框架，解决芯片验证中波形调试的基础设施瓶颈。通过将非结构化仿真数据转化为关系型SQLite数据库，结合多智能体协同机制，实现自然语言到SQL的精准转换与根因分析。在150条真实查询上达95.33%准确率，压缩后存储开销降低86.97%，显著提升验证效率与自动化水平，为自主EDA验证提供可行路径。]]></description><category></category></item><item><title><![CDATA[面向演进式企业AI智能体技能的持续流程级评估]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166991022</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166991022</guid><author>weixin_44626085</author><pubDate>Sun, 04 Oct 2026 16:36:49 +0800</pubDate><description><![CDATA[企业AI智能体技能并非静态产物：工具API变更、大模型版本迭代、业务运营反馈带来的需求修订，都会不断对技能进行修改迭代。当前主流验证方式仅校验最终输出结果的正确性，会系统性漏掉迭代过程中产生的流程层面行为漂移。本文提出一套面向企业智能体技能的持续评估框架，同时融合结果层面与流程层面质量校验；并在企业VAR（Value Aware Resiliency，价值感知弹性）系统内部的BVD（Business Value Determination，业务价值判定）两类技能变体上完成验证。]]></description><category></category></item><item><title><![CDATA[Mingbird：面向本地小开源模型完成真实任务的优先本地智能体管控框架]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166990997</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166990997</guid><author>weixin_44626085</author><pubDate>Sat, 03 Oct 2026 08:04:13 +0800</pubDate><description><![CDATA[Mingbird提出面向2-9B本地小模型的智能体管控框架，针对云原生框架在小模型上高频失效问题（如上下文耗尽、死循环、静默放弃），设计10项核心机制，包括字节级零净增长预填充、完成校验网关、签名级死循环检测等。在自研LRAB基准（288组实验）与第三方τ²-bench上，Mingbird综合得分达0.886和0.856，显著优于goose、opencode等基线，且2B模型无性能断崖，验证了管控框架对小模型能力释放的关键作用。]]></description><category></category></item><item><title><![CDATA[不是所有经验都适合存入模型权重：面向自改进GUI智能体的组件路由框架]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166991046</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166991046</guid><author>weixin_44626085</author><pubDate>Sat, 03 Oct 2026 08:03:50 +0800</pubDate><description><![CDATA[本文提出组件路由框架，破解自改进GUI智能体经验复用的矛盾：将轨迹拆解为定位器、过程序列、状态事实、经验教训四类组件，基于重复出现度与状态条件依赖性两个可预计算属性，动态分配存储路径。实验表明，高重复度组件（如定位器、经验教训）宜存权重，低重复度且强状态依赖者（如过程序列、状态事实）宜放上下文。该规则在24组测试中全预测正确，平均性能优于单一方案+3.5%，显著提升智能体自迭代效率。]]></description><category></category></item><item><title><![CDATA[全局一致性：每个智能体均局部正确，但团队整体仍然出错]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166990814</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166990814</guid><author>weixin_44626085</author><pubDate>Fri, 02 Oct 2026 12:02:47 +0800</pubDate><description><![CDATA[本文揭示多智能体系统中“局部正确但全局错误”的一致性问题，提出其本质为状态缺失与信息碎片化所致。通过观测混淆不可行性定理证明：即使模型能力强大，若局部视图无法区分不同全局状态，任何策略均无法保证全局正确。进一步指出，即便信息完整，局部合法片段拼接仍可能因循环依赖或预算超支导致全局不一致。为此，构建基于拓扑超图、群胚、层与范畴的数学框架，定义管控器需维护的关键语义结构，实现跨组件一致性校验。实证表明，仅靠增强模型无法解决该问题，而引入上下文工程与管控器可显著提升系统可靠性，且在预算控制、本体对齐等任务中实现零]]></description><category></category></item><item><title><![CDATA[Mímir：面向长时序灌溉控制的物理约束大语言模型智能体]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166990915</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166990915</guid><author>weixin_44626085</author><pubDate>Fri, 02 Oct 2026 12:02:25 +0800</pubDate><description><![CDATA[Mímir是一种面向长时序灌溉控制的物理约束大语言模型智能体，提出双时间尺度架构：快循环通过确定性仿真与数值校验修复决策，慢循环将失败模式沉淀为持久上下文原则，而物理模型、评估器与执行约束全程不可修改。在多地块、多年份回溯评估中，相较历史调度减少51%用水量，消融实验验证各模块必要性。该工作表明，语义推理与有界自优化可结合，但物理真值与执行权必须由显式数值机制保障。]]></description><category></category></item><item><title><![CDATA[Cogentic：面向自动定理发现的多智能体编排框架]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166946250</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166946250</guid><author>weixin_44626085</author><pubDate>Thu, 01 Oct 2026 15:02:33 +0800</pubDate><description><![CDATA[Cogentic是一个面向开放数学研究问题的多智能体定理发现框架，通过迭代式“证明-验证”循环，实现无需人工干预的自动定理发现。系统基于Gemini大模型，编排多个智能体并行探索不同证明方向，采用双重对抗验证机制与持久化已验证账本，有效复用中间成果。在在线学习、拍卖理论等五大理论计算机科学开放问题上，成功产出经专家核验的新定理，部分结果突破已有最优界。全部成果公开于项目网站，展示了大模型在科研级推理中的潜力。]]></description><category></category></item><item><title><![CDATA[WorldAuditBench：面向多模态智能体的交互式三维世界审计评测基准]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166946230</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166946230</guid><author>weixin_44626085</author><pubDate>Thu, 01 Oct 2026 15:01:06 +0800</pubDate><description><![CDATA[摘要（≤150字）： 本文提出WorldAuditBench，首个面向多模态智能体的交互式三维世界审计评测基准，涵盖13个仿真环境、213项异常任务，覆盖五类物理与语义异常。通过VLM-only与VLA-VLM两阶段范式评测，结果显示模型最高成功率仅42.3%，远低于人类基线83.4%。实验揭示智能体在动作探索与视觉推理耦合、证据收集与识别方面存在显著短板，为具身AI在复杂交互环境中的可靠性研究提供关键测试平台。]]></description><category></category></item><item><title><![CDATA[SCA：面向GUI智能体强化学习的空间信用分配方法]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166888426</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166888426</guid><author>weixin_44626085</author><pubDate>Wed, 30 Sep 2026 10:15:16 +0800</pubDate><description><![CDATA[GUI智能体将自然语言指令映射到可视化界面上的可执行动作。现有的组相对强化学习，会对同一GUI状态采样多条响应并对比奖励，以此改进动作预测。但二元评估会把空间位置不同的失败点击视作完全等价；当全部采样点击全部失败时，无法提供任何相对学习信号。针对该缺陷，本文提出。]]></description><category></category></item><item><title><![CDATA[PrecogUI：基于预认知仿真与经验检索的主动式GUI智能体]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166887179</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166887179</guid><author>weixin_44626085</author><pubDate>Wed, 30 Sep 2026 10:03:12 +0800</pubDate><description><![CDATA[现有的反应式图形用户界面（GUI）智能体在长视界、动态场景中极易失效；弹窗、黑屏等意外扰动会分散智能体注意力，引发连锁式故障。针对该问题，本文提出。]]></description><category></category></item><item><title><![CDATA[SeLATM：面向数据探索与资源效率的片段级智能体主题建模]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166836555</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166836555</guid><author>weixin_44626085</author><pubDate>Tue, 29 Sep 2026 10:46:26 +0800</pubDate><description><![CDATA[SeLATM提出一种片段级智能体主题建模框架，通过将文档切分为句子/段落片段，基于聚类生成主题，并引入多智能体反馈回路实现主题拆分与合并的双向精炼。该方法显著降低LLM调用开销，支持文档级多主题分布输出，提升主题粒度合理性与可解释性。在公开及工业金融数据集上，SeLATM在建模质量与资源效率上均优于现有方法。]]></description><category></category></item><item><title><![CDATA[LOHA‑ACD：压缩你所观察的内容而非你所说的内容——面向隐式观测软件工程智能体的锚定上下文蒸馏]]></title><link>https://blog.csdn.net/weixin_44626085/article/details/166836089</link><guid>https://blog.csdn.net/weixin_44626085/article/details/166836089</guid><author>weixin_44626085</author><pubDate>Tue, 29 Sep 2026 10:41:45 +0800</pubDate><description><![CDATA[本文提出LOHA-ACD框架，针对软件工程智能体上下文过长问题，创新性地“压缩观测而非输出”。通过LOHA布局将早期工具观测压缩为软token，保留近期观测与智能体输出的原始文本；结合ACD锚定蒸馏训练，使模型学会读取隐式表征的同时，以原始基座模型行为为锚点，防止动作漂移。实验表明，该方法在保持任务解决率的前提下，显著降低上下文用量（最高降57%），提升服务吞吐量达1.9倍，有效平衡了压缩效率与智能体性能。]]></description><category></category></item></channel></rss>