- 博客(453)
- 资源 (43)
- 收藏
- 关注
原创 一次性总结数十个具身模型(24-25年Q1):从训练数据、动作预测、RL应用到Robotics VLM、VLA等(含模型架构、训练方法)
本文一开始是属于此文的前言的,但考虑到其重要性,加之那么大一张表格 看下来 阅读体验较差,故抽出取来独立成文且拆分之具身的论文解读过很多之后,便会发现整个今24年的具身模型/策略大概如下所示——目前全网独一份「(建议按照从下至上的顺序看,且,我后续也会不断完善之——毕竟还有很多并未囊括于下表中,如转载请于文章开头标明作者July及本文链接。
2025-02-01 15:20:33
24378
11
原创 π0——用于通用机器人控制的VLA模型:一套框架控制7种机械臂(基于PaliGemma和流匹配的3B模型)
在此文之前,我花了一天半,详细解读了清华这个机器人扩散大模型RDT,包括其每一个附录,并在上文中预告说:下一篇是一个3B的机器人大模型打通7种不同品牌的机械臂,这几个工作宣告机器人真正进入大模型时代故,本文来了。
2024-11-04 00:11:59
55419
35
原创 一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba(被誉为Mamba最佳解读)
如本文开头所说,mamba论文的一作Albert Gu多年来一直在推动SSM的发展他在SSM的基础上,通过此篇论文《》首次提出了结构化状态空间S4(这里有关于S4的更多论文),但这篇论文的可读性比较差当然,作者在YouTube上有一个关于这篇S4论文的精彩解读,比S4论文的可读性提高很多,且本文中也应用了其中的部分PPT截图,但还可以更加通俗易懂。
2023-12-11 12:48:36
438391
393
原创 ChatGPT技术原理解析:从RL之PPO算法、RLHF到GPT4、instructGPT
本篇ChatGPT笔记会全力做到,通俗易懂且循序渐进(尽最大努力让每一个初学者哪怕是文科生都能没有障碍的读懂每一字一句、每一个概念、每一个公式)一方面,对于想了解ChatGPT背后原理和如何发展而来的,逐一阐述从GPT/GPT2/GPT3到强化学习、PPO算法,最后再到instructGPT、ChatGPT、SeqGAN且本文之前,99%的文章都不会把PPO算法从头推到尾,本文会把PPO从零推到尾,按照“RL-策略梯度-重要性采样(重要性权重)-TRPO(增加信任区域和KL散度约束)-PPO”的顺序逐步
2023-01-15 22:01:27
225323
146
原创 程序员面试、算法研究、机器学习、大模型/ChatGPT/AIGC、论文审稿、具身智能/人形机器人、RAG等20大系列集锦
程序员面试、算法研究、编程艺术、红黑树、机器学习5大经典原创系列集锦与总结作者:July--结构之法算法之道blog之博主。时间:2010年10月-2018年5月,一直在不断更新中..出处:http://blog.csdn.net/v_JULY_v。说明:本博客中部分文章经过不断修改、优化,已集结出版成书《编程之法:面试和算法心得》。前言开博4年有余,...
2020-01-05 20:42:56
777467
508
原创 CNN笔记:通俗理解卷积神经网络
2012年我在北京组织过8期machine learning读书会,那时“机器学习”非常火,很多人都对其抱有巨大的热情。当我2013年再次来到北京时,有一个词似乎比“机器学习”更火,那就是“深度学习”。本博客内写过一些机器学习相关的文章,但上一篇技术文章“LDA主题模型”还是写于2014年11月份,毕竟自2015年开始创业做在线教育后,太多的杂事、琐碎事,让我一直想再写点技术性文章但每每恨时间抽不开。然由于公司在不断开机器学习、深度学习等相关的在线课程,耳濡目染中,总会顺带着学习学习。
2016-07-02 22:14:50
932635
428
原创 支持向量机通俗导论(理解SVM的三层境界)
动笔写这个支持向量机是费了不少劲和困难的,原因很简单一者这个东西本身就并不好懂,要深入学习和研究下去需花费不少时间和精力二者这个东西也不好讲清楚,尽管网上已经有朋友写得不错了(见文末参考链接),但在描述数学公式的时候还是显得不够。得益于同学白石的数学证明,我还是想尝试写一下,希望本文在兼顾通俗易懂的基础上,真真正正能足以成为一篇完整概括和介绍支持向量机的导论性的文章本文在写的过程中,参考了不少资料,包括《支持向量机导论》、《统计学习方法》及网友pluskid的支持向量机系列等等,于此,还是一篇。
2012-06-01 22:48:43
1542192
809
原创 τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估
本文摘要:τ0-VLA提出了一种分层机器人基础模型,通过世界模型引导的测试时计算来提升长时程任务中的决策质量。该系统采用高层策略生成候选子任务,结合世界模型预测视觉结果和价值模型评估候选方案,形成"提案-预测-评估"的推理循环。低层策略则在统一动作空间上执行生成的子任务,支持多种机器人形态操作。实验表明,这种分层推理机制显著提高了任务成功率和子任务预测准确率。该方法创新性地将语言子任务搜索与视觉预测相结合,在执行前评估候选方案,从而优化决策过程。
2026-07-29 20:27:03
365
原创 Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应)
本文提出Robo-ValueRL框架,旨在通过可靠的价值函数提升离线到在线强化学习在机器人操作任务中的性能。该框架包含三个关键组件:历史条件化价值估计器、质量条件化视觉-语言-动作(VLA)策略预训练和在线残差自适应模块。 研究团队设计了全局进展和局部偏好两个指标来评估价值函数的可靠性,发现可靠的价值估计能显著提升策略性能。实验表明,在240小时离线数据和3000条在线轨迹的测试中,该方法使毫米级芯片插入任务的力控成功率提升至86%。 该工作主要贡献在于: 提出统一框架分析价值可靠性对策略优化的影响 开发历
2026-07-28 14:52:35
358
原创 RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步
摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结合序列动作强制与截断反向传播技术,该方法支持从单次人类示范中学习(成功率60%)和实时策略改进(性能提升36%),在持
2026-07-21 23:49:12
645
2
原创 ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能
本文介绍了ABot-AgentOS,一个通用机器人智能体操作系统,旨在连接高层语义推理与物理执行。该系统整合了多模态感知、记忆、推理和技能执行功能,支持跨不同机器人平台的运行。ABot-AgentOS采用边缘-云协同架构,包含验证感知的ReAct框架、分层LLM智能体(主LLM、SkillRunner和Verifier)以及多模态记忆系统。其创新点在于将认知层与硬件解耦,通过场景条件驱动的任务规划、过程执行隔离和多阶段验证机制,解决了具身智能中执行不确定性、长期记忆和跨平台泛化等关键挑战。该系统为构建可扩展
2026-07-17 15:56:33
887
1
原创 HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆
HoloAgent-0是一个面向真实世界机器人的统一具身智能体框架,通过三层架构实现闭环执行:1) Embodied AgentOS作为运行时层进行任务规划与监控;2) 技能层将机器人能力抽象为可组合的带类型动作;3) 记忆层维护3D空间记忆和执行历史。该框架通过ROS2接口连接异构机器人能力,支持导航、操作、全身运动等技能的组合执行,并利用持久化记忆实现长期任务跟踪和失败恢复。实验验证了其在3D语义建图、长时序导航和跨机器人协作等方面的能力,为具身智能体提供了系统级的解决方案。
2026-07-14 17:30:41
963
原创 FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换
本文提出FurnitureVLA方法,通过视觉-语言-动作模型解决真实尺度双臂家具装配的挑战。针对长时序、高精度装配任务,该方法将装配过程分解为语义子任务,并开发进度增强型VLA模型,在预测动作的同时输出子任务进度信号以降低误差累积。系统包含可扩展仿真流水线生成专家数据,以及优化的VR远程操作系统采集真实示教数据。实验在三种IKEA家具上验证了方法的有效性,重点关注双臂协同操作、几何对齐精度等关键因素。相比现有单臂玩具尺度装配研究,该方法首次实现了真实尺度双臂家具的通用装配策略。
2026-07-13 21:12:45
854
原创 T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务
如原论文所说,人类的灵巧操作不仅依赖视觉,感知和快速响应细粒度触觉信号的能力。诸如将一张薄卡片滑入卡槽、或用钥匙开锁等日常任务,对人类而言不费吹灰之力,但对当前的机器人学习策略来说仍然充满挑战要掌握这类任务,需要具备触觉-反应行为:即对触觉信号作出即时的闭环运动响应,其速度远快于传统基于视觉的控制回路所能达到的水平然而,将现有的视觉-语言-行动(Vision-Language-Action, VLA)模型适配到依赖触觉反馈的操作任务,面临两大挑战。
2026-07-13 00:21:19
992
原创 T-WAM——用于富接触操作的视觉-触觉世界动作模型:在统一的流匹配框架下联合学习未来视觉预测、触觉形变预测以及动作预测(且在插入透明导管场景中增大触觉的权重)
VT-WAM论文提出了一种创新的视觉-触觉世界动作模型,用于解决富接触机器人操作任务中的关键挑战。针对现有方法中触觉信息利用不足的问题,VT-WAM通过两个核心创新实现了突破:非对称MoT注意力机制将动作预测与触觉演化动态耦合,使模型能同时获取全局视觉场景和局部触觉接触信息;接触门控AVTAG模块通过训练阶段的排序损失,有效缓解了视觉主导偏置问题。该模型在统一流匹配框架下联合学习视觉预测、触觉形变预测和动作预测,既保留了触觉动态建模能力,又避免了推理时的视觉预测开销。实验表明VT-WAM在高接触操作任务上显
2026-07-12 15:42:05
863
原创 Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预
本文介绍了一种名为Focus-Then-Contact(FTC)的轻量级人在回路强化学习框架,专为机器人接触密集型任务设计。该框架通过三个关键创新提升性能:(1)利用残差强化学习细化模仿学习得到的基础策略;(2)基于关键帧的可供性引导设计稠密奖励函数;(3)采用双腕部相机配置和人类干预机制。FTC在USB插拔等精细操作任务中展现出高效学习能力,解决了传统方法在真实世界中训练效率低、计算成本高的问题。该方法与作者此前独立开发的"ACT宏观导引+真机残差RL"电池包充电方案高度相似,验证了该
2026-07-05 12:12:28
1207
2
原创 OpenHLM——全身VLA下的行走-操作:sonic作为运控底层,π0.5作为VLA的初始化策略(且基于umi改造出可以做全身数采的HuMI)
摘要: 本文介绍了OpenHLM系统,这是一个针对全身人形机器人行走-操作一体化任务的实证研究框架。通过三个阶段(控制器与遥操作、VLA策略设计、异构协同训练),系统解决了全身控制中的关键问题:基于关节的全身遥操作优于解耦控制和VR三点控制;非人形机器人预训练的VLA可有效迁移至人形任务;结合廉价静态数据可扩展技能范围。实验在HLM-12基准上验证了系统能力,包括协调行走、抓取、使用身体部位操作及环境约束任务,平均任务进度达91%。研究揭示了动作MSE与真实表现的弱相关性,并强调了机器人预训练的重要性。
2026-06-26 23:17:10
1616
原创 Q-Guided Flow——RL中基于流策略的推理时梯度引导:不直接在噪声动作上求Q的梯度,也不对整条去噪链做BPTT,而是一步Euler积分且把Jacobian直接换成单位矩阵
《强化学习中流策略的测试时梯度引导》论文摘要 本文提出QGF方法,通过测试时梯度引导解决流策略在强化学习中的优化难题。针对扩散/流模型策略在RL训练中的不稳定性问题,作者创新性地采用"预训练+推理优化"的两阶段方案:先通过行为克隆训练参考策略,再在推理时利用价值函数梯度引导动作生成。QGF通过单步欧拉积分近似完全去噪动作,避免传统方法需要的多步反向传播,显著提升了计算效率和稳定性。实验表明,该方法在保持流策略多模态优势的同时,有效实现了奖励最大化,为复杂策略的强化学习提供了新思路。
2026-06-24 12:32:42
1535
1
原创 Humanoid-GPT——采用因果注意力机制的类GPT追踪器:通过扩展“数据规模、模型结构、训练多样性”,最终实现零样本动作追踪
前言26年6月初,来自1清华大学 2Galbot Inc. 3上海交通大学 4北京大学 5上海启智研究院的研究者提出了Humanoid-GPT,这是一种 GPT 风格的 Transformer 模型,采用因果注意力机制,并在十亿级规模的动作语料上进行训练,用于全身控制。
2026-06-21 17:24:38
1540
原创 HumanEgo——从半小时人类第一视角视频中进行零样本学习的4大关键点:对人类手臂进行图像修补、将每只手和每个物体编码为一个交互中心Token、流匹配策略、稠密辅助目标
文章摘要 HumanEgo提出了一种从人类第一视角视频中学习机器人策略的新框架,仅需30分钟人类示范视频即可实现零样本迁移。该方法通过图像修复消除人类手臂的视觉差异,并利用交互中心Token(ICT)编码手-物空间关系,弥合人与机器人的具身鸿沟。结合流匹配策略与稠密辅助目标(轨迹、物体运动等),HumanEgo在4个真实任务中平均成功率高达92.5%,仅需15分钟数据即可达75%成功率,且无需机器人数据或环境适配,显著优于传统远程操控方法41%。其核心创新在于将技能定义为交互几何而非具体形态,实现了高效、硬
2026-06-08 23:46:32
2208
3
原创 ABot-Claw与我司改造升级的七月具身Agent OS——扩展OpenClaw以驱动双足人形自主干活的三个关键点:统一具身接口、视觉多模态记忆、基于奖励模型的执行反馈模块
如原论文所说,OpenClaw 提供了具有完整系统权限的本地化运行时环境,但缺乏支撑长时长、多机器人执行所需的具身控制架构为此,来自阿里巴巴的高德团队提出 ABot-Claw,这是 OpenClaw 的具身扩展
2026-06-06 19:20:09
2673
4
原创 Galaxea G0.5——升级“VLA自回归建模”范式:摒弃VLM上添加动作专家的模式,而是构建统一模型,用一套权重,在同一个自回归token序列中同时生成推理与动作(含VLA-0的详解)
本文提出G0.5模型,将视觉-语言-动作(VLA)任务统一为单一自回归序列生成过程。该模型采用预训练的视觉语言模型Qwen3.52B作为主干,通过结构化动作分词器和原生思维链机制,实现感知、推理与动作生成的端到端统一。关键创新包括:1)跨载体动作分词器将异构机器人动作映射到共享词表;2)在同一自回归序列中交错生成推理token与动作token;3)视觉记忆模块注入历史信息。相比主流"VLM作为编码器"架构,G0.5保留了VLM的生成能力,支持通过提示直接调节动作粒度、任务时长和分布外场景
2026-06-04 18:18:09
2589
原创 τ0-WM——智元的视频-动作世界模型:组合“遥操、umi、人类第一人称视角”数据,未来视觉Latent助力动作生成,然后重新加噪去噪,若自洽取表现最好者直接执行,否则模拟推演找出最佳视觉指引重新生成
本文提出τ0-WorldModel(τ0-WM),这是一个统一的视频-动作世界模型,整合了策略学习、视频预测和动作评估功能。该模型基于共享的视频扩散骨干网络,提供两种接口:视频动作模型(VAM)联合预测未来视觉表示和连续动作片段;动作条件视频模拟器(ACVS)则评估候选动作的未来效果和任务进展。模型在27,300小时的异构数据(包括机器人遥操作、UMI交互和人类视频)上训练,通过模态特定监督掩码处理不同数据源的信号差异。τ0-WM创新地将动作生成与效果预测统一,在执行前通过"提议-评估-修订&qu
2026-06-01 12:30:18
2833
4
原创 GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)
摘要:GR00T N1.6和N1.7模型在视觉语言与机器人控制方面取得重要进展。N1.6采用改进的Cosmos-2B VLM架构,支持原生图像编码,使用相对动作预测和新增数千小时遥操作数据。N1.7引入跨形态的相对末端执行器动作空间,采用Qwen3-VL架构的Cosmos-Reason2-2B模型,新增人类视频预训练和部署工具链。特别推出SONIC全身控制系统,实现语言条件下的协调操作与移动,支持端到端的采集-微调-部署流程。这些改进显著提升了模型的泛化能力和控制精度。
2026-05-27 16:00:00
2726
原创 Realtime-VLA V2——如何让vla运行的更快:从让π0实时抓取下落的钢笔到让 VLA 运行得更快、更平滑且更精确
本文提出了一种在消费级GPU上实时运行视觉语言动作(VLA)模型的方法。通过CUDA图优化消除CPU开销、简化计算图减少冗余操作,作者将π0级VLA模型的推理延迟从100+毫秒降至27.3毫秒,实现了30Hz帧率和480Hz轨迹频率的实时控制。实验验证显示,优化后的模型在动态抓取任务中达到100%成功率。研究还提出了"全流式推理"框架,将VLA直接映射为完整的控制算法,突破了传统分层控制架构的限制。这些优化使大型VLA模型首次具备了处理严格实时任务的能力。
2026-05-20 14:41:47
2828
原创 一文通透Qwen3-VL——在交错式MRoPE、DeepStack、文本时间戳对齐机制的基础上,先预训练,再后训练(即分别SFT、蒸馏、RL)
阿里千问团队2025年9月发布的Qwen3-VL模型在视觉理解能力上实现重大突破。该模型引入VL-Thinking视觉深度思维链,支持跨时空因果推理;采用MRoPE-Interleave位置编码和DeepStack技术,显著提升长视频理解与视觉细节捕捉能力;原生支持256K token上下文,可扩展至百万级,实现长文档和视频的精准处理。此外,模型在视觉编程(图像/视频生成代码)、3D空间感知(相对坐标、遮挡关系判断)等方面表现突出,为具身智能奠定基础。技术架构上通过时间戳对齐机制和动态分辨率设计,大幅提升了
2026-05-08 15:57:45
3389
原创 DeepSeek-V4——迈向百万token上下文:保留V3的MoE和多token预测机制,提出混合注意力机制(CSA/HCA)、流形约束超连接mHC(替代残差)、Muon优化器(取代AdamW)
DeepSeek-V4系列推出两个预览版MoE语言模型:1.6T参数的DeepSeek-V4-Pro和284B参数的DeepSeek-V4-Flash,均支持100万token上下文。关键创新包括:混合注意力架构(CSA+HCA)提升长文本效率;流形约束超连接(mHC)增强残差连接;采用Muon优化器加速收敛。相比V3.2,V4-Pro在百万token场景下推理FLOPs降至27%,KV缓存降至10%;V4-Flash更优,分别降至10%和7%。模型预训练使用32T-33T token,后训练采用两阶段专家
2026-05-03 23:54:48
3781
原创 LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环
本文提出了一种"部署中学习"(Learning While Deploying)框架,通过机器人舰队规模的强化学习来优化通用机器人策略。该方法构建了一个数据闭环:部署的机器人集群产生多样化经验,共享策略聚合这些数据并持续改进,改进后的策略重新部署以收集更高质量的数据。研究团队设计了分布式隐式价值学习(DIVL)方法来处理异质部署数据中的多模态回报分布,并采用基于流的策略提取机制(QAM)实现稳定更新。实验在16台双臂机器人组成的舰队上进行,覆盖8个操作任务,结果显示该方法仅需数小时真实交
2026-04-30 22:53:08
3748
原创 ARM——用于长时序操作的优势奖励建模:采用三态标注策略(前进/后退/停滞),实现对相对优势的估计(含SARM详解)
本文提出了一种名为优势奖励建模(ARM)的新框架,用于解决长时间跨度机器人操作任务中的强化学习挑战。传统方法依赖稀疏奖励信号或高成本的人工标注,难以有效处理复杂任务中的非单调行为。ARM创新性地采用三态标注策略(前进、后退、停滞),通过多模态Transformer模型实现对相对优势的估计,而非传统的绝对进度评估。该方法显著降低了标注成本,同时提高了跨标注者的一致性。实验证明,ARM在毛巾折叠任务中取得了99.4%的成功率。该框架包含三个关键组件:优势奖励模型、全局进度重建系统和AW-BC策略优化方法,能够自
2026-04-29 00:09:26
3289
1
原创 HTD——基于触觉预测的人形行走-操作框架:融合视觉、本体感知、力反馈、触觉,同时预测动作、未来手部关节受力、由EMA目标编码器监督的未来触觉潜变量(可给面试者递杯咖啡)
本文提出了一种具身触觉梦境的人形Transformer(HTD)系统,用于解决仿人机器人行走-操作一体化任务中的关键挑战。HTD整合了基于强化学习的全身控制器、VR遥操作和多模态Transformer策略,实现了稳定的全身控制与灵巧手部操作的协同。创新性地采用"触觉梦境"机制,通过预测未来手部受力和触觉潜变量来增强接触感知能力,避免了传统方法中繁琐的多阶段训练。系统通过教师-学生框架训练下肢控制器,并利用VR采集高质量示范数据。实验表明,这种单阶段训练方法能有效学习接触感知的潜在动力学,
2026-04-23 18:29:30
3315
原创 π0.7——4层prompt下的技能组合泛化能力:先高层策略基于指令历史和当前画面输出子任务指令,后世界模型基于子任务指令生成子目标图像
摘要:本文介绍了新型机器人基础模型π0.7,该模型通过组合式泛化实现了接近语言模型的灵活任务处理能力。与现有视觉语言动作模型(VLA)不同,π0.7采用多模态提示策略,整合语言指令、策略元数据和子目标图像等丰富上下文信息,使其能从包含次优行为和失败案例的多样化数据中有效学习。模型架构基于50亿参数VLA,包含视觉编码器、记忆系统和动作专家模块。实验表明,该方法在灵巧操作、跨形态迁移和新任务组合等方面展现出显著优势,如零样本完成叠衣服、操作空气炸锅等复杂任务。研究强调了精细提示设计对提升机器人基础模型泛化能力
2026-04-19 17:37:07
4815
1
原创 ViVa——基于视频生成模型的机器人RL价值估计:比原先基于VLM的价值函数,能更好的在动态交互环境中对当前进度和未来走势下所带来的回报做估计
如原论文所说,觉-语言-动作(Vision-Language-Action, VLA)模型(Intelligence 等,2025;Kim 等,2024;Li 等,2025;Team 等,2026;Zitkovich 等,2023)通过利用大规模预训练,在实现跨多种任务的通用操作方面取得了重大进展然而,要在真实世界环境中取得成功,远不止需要静态场景理解:机器人交互在部分可观测性和延迟反馈的条件下展开,其中决策的后果仅在较长的时间跨度后才会显现(Huang 等人,2022 年;
2026-04-16 13:50:55
3562
原创 MEM——解决VLA长时记忆问题的框架:短时靠高效视频编码抓细节,长线凭文本记忆系统记进度
本文提出多尺度具身记忆(MEM),一种融合视觉与语言模态的混合记忆架构,用于解决机器人长时任务中的记忆问题。针对不同时间尺度的记忆需求,MEM结合基于视频编码器的稠密短时视觉记忆(处理遮挡、动态调整)和基于语言模型的压缩长时语义记忆(跟踪任务进度)。通过分层策略设计,高层策略维护语言记忆并生成子任务指令,低层策略利用视觉记忆执行精细操作。实验表明,该系统可支持长达15分钟的复杂任务(如厨房整理),在保持实时性的同时显著提升任务完成率。该工作突破了传统单一模态记忆的局限性,为具身智能的长时程任务提供了实用解决
2026-04-12 00:22:06
3728
原创 BRS——斯坦福李飞飞团队推出的全身轮式人形操作框架:推出遥操作接口JoyLo与全身视觉-运动注意策略WB-VIMA
提出了 BEHAVIOR ROBOTSUITE(BRS),这是一个面向多样家务任务的全身操作综合框架。BRS 基于一台具备双臂、轮式底盘以及 4 自由度躯干的机器人构建,集成了一套高性价比的全身远程操作接口用于数据采集,并提出了一种用于学习全身视觉运动策略的新算法
2026-04-05 00:31:05
3929
原创 Fast-WAM——训练时保留视频联合训练(虽同时生成但动作token不看视频token),在推理时则移除显式的未来视频生成,直接在单次前向中,依托得到的潜在世界表征KV Cache预测动作
本文探讨了世界模型代理(WAM)的性能优势来源,提出了Fast-WAM架构来解耦训练阶段的视频建模与推理阶段的显式未来生成。研究发现,视频预测的主要价值在于训练阶段提升世界表征,而非推理阶段的未来观测生成。Fast-WAM在保留视频协同训练的同时,跳过推理时的未来预测,仍能保持竞争力。实验表明,去除视频共训练会导致更大性能下降,证实了训练阶段视频建模对学习物理先验和动作相关表征的关键作用。这一发现为WAM设计提供了新思路,在保持性能的同时提高了推理效率。
2026-03-31 23:57:16
4467
3
原创 RLT——π0.6引导的在线RL:极简MLP结构的Actor-Critic在“VLA浓缩Token感知与VLA参考动作先验”的双重加持下进行在线快速微调,最终从粗到细搞定拧螺丝和充电器插入
摘要:本文提出了一种轻量级方法,通过RLtoken实现对预训练视觉-语言-动作模型(VLA)的高效在线强化学习微调。该方法使VLA输出紧凑的RLtoken表征,保留预训练知识的同时作为RL接口,在其上训练小型actor-critic网络进行动作精炼。实验表明,仅需几小时真实世界练习即可显著提升VLA在精确任务上的表现,解决了传统RL方法难以高效微调大规模VLA的问题,在保持模型泛化能力的同时实现了快速适应。
2026-03-26 11:44:34
4943
原创 GigaWorld-Policy——以动作为中心的世界动作模型:为降低推理延迟,训练用视频,推理能可选性的去视频(类似τ0-WM)
本文提出GigaWorld-Policy,一种高效的以动作为中心的世界-动作模型。相比现有方法依赖显式视频生成导致高延迟和误差累积,该模型将未来视觉动态作为监督信号而非必要输出,在训练时联合优化动作预测和视觉动态预测,推理时可直接输出动作指令而无需生成视频。模型采用课程式训练流程,先通过大规模视频预训练获取物理先验,再在具身数据上微调,最后对齐目标机器人的控制接口。实验表明该方法在保证性能的同时显著降低计算开销,实现低延迟闭环控制。
2026-03-23 23:52:37
4080
1
原创 Ψ0——人形全身VLA:先用800h人类自视角视频数据和30h的真实机器人交互数据预训练VLM,再后训练MM-DiT,最后用AMO做下肢RL跟踪
摘要:本文提出Ψ0模型,一种面向人形机器人全身操控的视觉语言动作基础模型。该模型采用多阶段训练范式:首先在大规模人类第一视角视频(800小时)上预训练视觉语言模型,学习通用运动先验;随后在真实机器人数据(30小时)上训练基于流模型的动作专家,实现精确关节控制。模型采用三重架构:视觉语言骨干网络(System-2)提取特征,多模态扩散Transformer(System-1)预测动作,结合现成的RL控制器(System-0)实现43自由度全身控制。实验表明,该方法相比联合训练范式能更高效地从人类视频中迁移知识
2026-03-21 19:15:57
4339
6
原创 HIL-DAFT——双智能体的人类在环RL框架微调的人形VLA(先离线预热后在线交互):为完成螺栓装配,主智能体负责常规操作、精细化执行体依据语音指令实行细粒度调整
摘要: 本文提出了一种双执行体的人类在环RL框架(HIL-DAFT),用于在双足人形机器人上部署视觉-语言-动作(VLA)模型与离线到在线强化学习(RL)的结合。该框架通过主执行体生成通用动作,精细化执行体在潜在噪声空间中进行细粒度调整,采用“对话与微调”机制将物理纠正转化为语义指令。实验表明,该方法在101分钟在线微调后实现了100%的子任务成功率,并在长时序操作中保持50%的完成率,展现了高效的样本适应性和多任务扩展潜力。
2026-03-15 00:24:12
3827
原创 EgoScale——第一视角的2万小时人类标注数据扩展VLA的灵巧操作能力(提出human egocentric data下的缩放定律):先大规模人类预训练,再人机对齐,最后单条示范微调
摘要:EgoScale提出了一种基于大规模自中心人类数据的灵巧操作迁移框架。通过在20,854小时标注视频上训练视觉-语言-动作模型(规模超以往工作20倍),发现了人类数据规模与验证损失间的对数线性关系,该损失与机器人性能高度相关。采用两阶段迁移方案:先进行大规模人类预训练,再通过少量人机对齐数据实现迁移。实验表明,该方法仅需极少量机器人示范即可实现复杂操作,在折叠衬衫任务上达88%成功率,并能泛化至不同形态的机器人平台(如三指机械手),性能提升超30%。
2026-03-02 18:39:29
6260
1
[第一部分]精选微软等公司数据结构+算法经典面试100题[1-40题]
2010-10-23
[第二部分]精选微软等公司结构+算法面试100题[41-60题]
2010-11-05
新鲜出炉:微软等数据结构+算法面试100题第81-100题[V0.1版最后20题]
2010-12-05
[汇总I]精选微软等数据结构+算法面试100题[第1-60题]
2010-11-12
数学建模10大算法详解+程序源码打包
2011-01-29
十三个经典算法研究PDF文档[带目录+标签]
2011-07-08
红黑树的c实现源码与教程
2011-01-03
[最新答案V0.4版]微软等数据结构+算法面试100题[第41-60题答案]
2011-01-04
结构之法 算法之道 第一期博文CHM文件集锦[版权所有,侵权必究]
2011-03-06
微软面试100题系列之高清完整版PDF文档[带目录+标签]by_July
2012-09-20
结构之法算法之道blog博文集锦第7期CHM文件
2012-07-29
读书会·北京第1期之DeepQA框架&Siri;架构PPT
2012-02-13
[最新整理公布][汇总II]微软等数据结构+算法面试100题[第1-80题]
2010-11-20
基于给定的文档生成倒排索引的全部源码
2012-01-10
最新十五个经典算法研究与总结之高清完整PDF文档[带目录+标签]by_July
2012-08-05
[开源分享]推荐一款界面超酷的Pocket PC 掌上电脑[源码下载]
2010-12-08
结构之法算法之道博文集锦最新第五期(July、10.31日制作)
2011-10-31
程序员编程艺术第一~三十七章集锦 高清完整PDF版
2013-12-10
程序员编程艺术第一 ~二十七章(教你如何编程)高清完整PDF版by_July
2012-04-25
[极品收藏]Windows 核心编程完整中文pdf版(上)
2010-10-25
[极品收藏]Windows 核心编程完整中文pdf版(中)
2010-10-25
[极品收藏]Windows 核心编程完整中文pdf版(下)
2010-10-25
[答案V0.1版]精选微软数据结构+算法面试100题[前25题]
2010-10-30
[总结]各大内部排序算法性能比较+程序实现
2010-11-01
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅