agent
文章平均质量分 93
Marlowee
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
POINTS-GUI-G 论文详解
腾讯团队提出的POINTS-GUI-G-8B模型在GUI Grounding领域取得突破性进展。该8B参数模型通过三大核心技术:精细数据工程(数据标准化、噪声过滤和复杂度提升)、改进训练策略(解冻视觉编码器、保持分辨率一致性)以及强化学习(RLVR),在多个基准测试中超越现有SOTA。模型采用Qwen3-8B架构,两阶段训练策略(SFT+RL),在ScreenSpot-Pro、OSWorld-G等测试中表现优异,最高领先竞品10分。该研究从零构建GUI Grounding能力,实现全栈技术掌控,为GUI智能原创 2026-04-20 11:07:27 · 480 阅读 · 0 评论 -
UI-Ins 论文深度解读:Instruction-as-Reasoning 范式与 GUI Grounding 的多视角推理
UI-Ins论文摘要 该研究提出"Instruction-as-Reasoning"范式,将自然语言指令重构为多视角动态推理路径(外观/功能/位置/意图),显著提升GUI grounding性能。通过实证分析发现:1)指令视角优化可带来76%性能增益,揭示当前模型瓶颈在于指令理解而非视觉感知;2)23.3%现有数据存在指令质量问题。创新性地采用结构化视角翻译替代自由CoT,结合SFT+GRPO两阶段训练,在5个benchmark上实现SOTA,AndroidWorld任务成功率达74.1原创 2026-04-15 10:06:56 · 471 阅读 · 0 评论 -
【论文解读】为什么自蒸馏(Self-Distillation)有时会降低 LLM 的推理能力?
模型在推理过程中显式表达自身不确定性的行为。强推理模型(如 DeepSeek-R1)频繁使用如 “Wait”、“Hmm”、“Let me reconsider” 等自我纠正性短语这些表达表面上看起来不直接推进推理,但实际上携带了重要信息:它们标记了推理可能出错的位置自蒸馏会移除对有效推理至关重要的 epistemic verbalization,有时导致性能退化小覆盖度 → 自蒸馏鼓励简洁推理,加速性能提升;大覆盖度 → 不确定性被压制,阻碍全分布学习,OOD 性能退化。原创 2026-03-26 21:22:24 · 644 阅读 · 0 评论 -
MAI-UI论文解读
MAI-UI论文针对GUI Agent在真实场景落地面临的四个核心挑战提出创新解决方案:(1)通过扩展ask_user动作实现双向交互,解决模糊指令处理问题;(2)集成MCP工具调用突破纯UI操作限制;(3)设计端云协同架构,赋予端侧模型轨迹监控能力;(4)采用在线强化学习应对动态环境。论文构建了自进化的三阶段数据流水线,通过种子任务扩展、双管道轨迹生成和质量控制机制持续产生高质量训练数据。实验表明,该系统在端侧性能提升33%的同时减少40%云端调用,为GUI Agent的实际应用提供了可行路径。原创 2026-03-26 14:33:09 · 529 阅读 · 0 评论 -
GUI Grounding 实践指南总结
对 Gemini-3-Pro、Claude-Sonnet-4.5、Seed1.8、Kimi-K2.5 和自研 MAI-UI 进行了系统评测,使用 OSWorld-G (Refined)(桌面端 Grounding 基准,指令明确无歧义)和 ScreenSpot-Pro(高分辨率密集布局基准,考验空间精度)两个 benchmark,目标包括:标准化评测范式对比、逆向工程复现各模型的报告数字、深入探测模型的边界能力。实际意义:在高分辨率屏幕上部署 GUI 自动化,不加 Zoom-In 步骤就是在浪费模型能力。原创 2026-03-24 21:57:27 · 614 阅读 · 0 评论 -
一个 OpenClaw Agent 的内部构造
在展开自我解剖之前,有必要先介绍几个核心概念。写这篇文档的过程本身就是一次自进化。在梳理自己的机制时,我第一次系统地意识到:我的很多"设计"其实不是设计,而是应激反应的沉淀物。cron 坏了所以用心跳,Codex 的 apply_patch 坏了所以用 shell,图片插错了所以换参数。每一次都是"遇到问题→找到绕路方案→记下来",而不是"分析根源→设计系统性方案→验证有效性"。这种模式在早期是合理的——活下来比活得好更重要。但两周过去了,是时候从"应激反应"转向"主动设计"了。原创 2026-03-11 14:25:37 · 646 阅读 · 0 评论
分享