具身插拔与装配系列:从SERL到真机RL微调VLA、WAM
文章平均质量分 86
RL与VLA下的精密插拔与装配:含HIL-SERL
v_JULY_v
七月具身创办人,结构之法算法之道blog之博主
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Robo-ValueRL——面向离线到在线RL的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升(即在线残差策略自适应)
本文提出Robo-ValueRL框架,旨在通过可靠的价值函数提升离线到在线强化学习在机器人操作任务中的性能。该框架包含三个关键组件:历史条件化价值估计器、质量条件化视觉-语言-动作(VLA)策略预训练和在线残差自适应模块。 研究团队设计了全局进展和局部偏好两个指标来评估价值函数的可靠性,发现可靠的价值估计能显著提升策略性能。实验表明,在240小时离线数据和3000条在线轨迹的测试中,该方法使毫米级芯片插入任务的力控成功率提升至86%。 该工作主要贡献在于: 提出统一框架分析价值可靠性对策略优化的影响 开发历原创 2026-07-28 14:52:35 · 399 阅读 · 0 评论 -
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步
摘要:本文提出RoboTTT方法,通过将测试时训练(TTT)机制整合到机器人基础模型中,实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制,在训练和推理时动态更新模型参数,将历史信息压缩至权重空间,解决了长上下文建模的三大挑战。实验表明,RoboTTT-8K相比单步基线在复杂任务中性能提升87%,首次证明扩展上下文长度能稳定提升闭环性能(比1K上下文模型提升63%)。创新性地结合序列动作强制与截断反向传播技术,该方法支持从单次人类示范中学习(成功率60%)和实时策略改进(性能提升36%),在持原创 2026-07-21 23:49:12 · 708 阅读 · 1 评论 -
FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换
本文提出FurnitureVLA方法,通过视觉-语言-动作模型解决真实尺度双臂家具装配的挑战。针对长时序、高精度装配任务,该方法将装配过程分解为语义子任务,并开发进度增强型VLA模型,在预测动作的同时输出子任务进度信号以降低误差累积。系统包含可扩展仿真流水线生成专家数据,以及优化的VR远程操作系统采集真实示教数据。实验在三种IKEA家具上验证了方法的有效性,重点关注双臂协同操作、几何对齐精度等关键因素。相比现有单臂玩具尺度装配研究,该方法首次实现了真实尺度双臂家具的通用装配策略。原创 2026-07-13 21:12:45 · 899 阅读 · 0 评论 -
T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务
如原论文所说,人类的灵巧操作不仅依赖视觉,感知和快速响应细粒度触觉信号的能力。诸如将一张薄卡片滑入卡槽、或用钥匙开锁等日常任务,对人类而言不费吹灰之力,但对当前的机器人学习策略来说仍然充满挑战要掌握这类任务,需要具备触觉-反应行为:即对触觉信号作出即时的闭环运动响应,其速度远快于传统基于视觉的控制回路所能达到的水平然而,将现有的视觉-语言-行动(Vision-Language-Action, VLA)模型适配到依赖触觉反馈的操作任务,面临两大挑战。原创 2026-07-13 00:21:19 · 1046 阅读 · 0 评论 -
T-WAM——用于富接触操作的视觉-触觉世界动作模型:在统一的流匹配框架下联合学习未来视觉预测、触觉形变预测以及动作预测(且在插入透明导管场景中增大触觉的权重)
VT-WAM论文提出了一种创新的视觉-触觉世界动作模型,用于解决富接触机器人操作任务中的关键挑战。针对现有方法中触觉信息利用不足的问题,VT-WAM通过两个核心创新实现了突破:非对称MoT注意力机制将动作预测与触觉演化动态耦合,使模型能同时获取全局视觉场景和局部触觉接触信息;接触门控AVTAG模块通过训练阶段的排序损失,有效缓解了视觉主导偏置问题。该模型在统一流匹配框架下联合学习视觉预测、触觉形变预测和动作预测,既保留了触觉动态建模能力,又避免了推理时的视觉预测开销。实验表明VT-WAM在高接触操作任务上显原创 2026-07-12 15:42:05 · 903 阅读 · 0 评论 -
Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预
本文介绍了一种名为Focus-Then-Contact(FTC)的轻量级人在回路强化学习框架,专为机器人接触密集型任务设计。该框架通过三个关键创新提升性能:(1)利用残差强化学习细化模仿学习得到的基础策略;(2)基于关键帧的可供性引导设计稠密奖励函数;(3)采用双腕部相机配置和人类干预机制。FTC在USB插拔等精细操作任务中展现出高效学习能力,解决了传统方法在真实世界中训练效率低、计算成本高的问题。该方法与作者此前独立开发的"ACT宏观导引+真机残差RL"电池包充电方案高度相似,验证了该原创 2026-07-05 12:12:28 · 1252 阅读 · 1 评论 -
LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环
本文提出了一种"部署中学习"(Learning While Deploying)框架,通过机器人舰队规模的强化学习来优化通用机器人策略。该方法构建了一个数据闭环:部署的机器人集群产生多样化经验,共享策略聚合这些数据并持续改进,改进后的策略重新部署以收集更高质量的数据。研究团队设计了分布式隐式价值学习(DIVL)方法来处理异质部署数据中的多模态回报分布,并采用基于流的策略提取机制(QAM)实现稳定更新。实验在16台双臂机器人组成的舰队上进行,覆盖8个操作任务,结果显示该方法仅需数小时真实交原创 2026-04-30 22:53:08 · 3761 阅读 · 0 评论 -
π0.7——4层prompt下的技能组合泛化能力:先高层策略基于指令历史和当前画面输出子任务指令,后世界模型基于子任务指令生成子目标图像
摘要:本文介绍了新型机器人基础模型π0.7,该模型通过组合式泛化实现了接近语言模型的灵活任务处理能力。与现有视觉语言动作模型(VLA)不同,π0.7采用多模态提示策略,整合语言指令、策略元数据和子目标图像等丰富上下文信息,使其能从包含次优行为和失败案例的多样化数据中有效学习。模型架构基于50亿参数VLA,包含视觉编码器、记忆系统和动作专家模块。实验表明,该方法在灵巧操作、跨形态迁移和新任务组合等方面展现出显著优势,如零样本完成叠衣服、操作空气炸锅等复杂任务。研究强调了精细提示设计对提升机器人基础模型泛化能力原创 2026-04-19 17:37:07 · 4880 阅读 · 0 评论 -
RLT——π0.6引导的在线RL:极简MLP结构的Actor-Critic在“VLA浓缩Token感知与VLA参考动作先验”的双重加持下进行在线快速微调,最终从粗到细搞定拧螺丝和充电器插入
摘要:本文提出了一种轻量级方法,通过RLtoken实现对预训练视觉-语言-动作模型(VLA)的高效在线强化学习微调。该方法使VLA输出紧凑的RLtoken表征,保留预训练知识的同时作为RL接口,在其上训练小型actor-critic网络进行动作精炼。实验表明,仅需几小时真实世界练习即可显著提升VLA在精确任务上的表现,解决了传统RL方法难以高效微调大规模VLA的问题,在保持模型泛化能力的同时实现了快速适应。原创 2026-03-26 11:44:34 · 5005 阅读 · 0 评论 -
RL-100——基于真实世界RL的高性能灵巧操作:先基于人类演示做模仿学习预训练,再做迭代式离线RL,最后真机在线RL
本文提出RL-100框架,通过结合模仿学习与强化学习提升机器人操作性能。该方法包含三个阶段:首先基于人类示范数据进行模仿学习预训练;然后通过迭代式离线强化学习优化策略;最后进行针对性在线微调。关键创新在于采用统一的PPO目标函数贯穿扩散去噪过程,实现稳定更新。为满足实时需求,通过一致性蒸馏将多步扩散压缩为单步控制器。实验表明,该框架能有效利用人类先验并超越人类表现,支持多种输入表示和控制模式,在真实机器人操作任务中展现出高可靠性和鲁棒性。原创 2026-02-20 16:46:30 · 5085 阅读 · 0 评论 -
RISE——组合式世界模型驱动的RL框架:基于视频扩散模型预测的未来视觉状态,和VLA估计的进度价值评估,以先离线预热后在线改进
摘要: RISE提出了一种通过组合式世界模型实现机器人自我提升的强化学习框架。针对现有视觉-语言-动作模型在动态任务中的脆弱性,以及真实世界强化学习面临的安全和成本限制,RISE构建了包含动力学预测和价值评估的世界模型。该模型利用视频扩散技术预测多视角未来状态,并通过进度感知的价值函数评估动作优势,从而在想象空间中实现高效策略优化。实验表明,RISE在真实机器人任务中显著优于传统方法,同时避免了昂贵的物理试错过程。(149字)原创 2026-02-18 23:07:31 · 4292 阅读 · 0 评论 -
GigaBrain-0.5M*(可对标π∗0.6)——从基于世界模型的RL中学习的VLA:通过“预测的价值和未来状态、经验数据、人工纠正”优化动作策略
摘要:本文提出GigaBrain-0.5M模型,通过世界模型增强的强化学习(RAMP)解决视觉-语言-动作(VLA)模型在长时程规划中的短视问题。该模型在GigaBrain-0.5M基础上,采用四阶段迭代训练:预训练世界模型预测未来状态和价值,微调策略生成动作,部署收集真实数据,并持续优化模型。相比π0.6的RECAP框架仅使用稀疏优势信号,RAMP利用世界模型提供更丰富的信息条件,理论上证明RECAP是RAMP的特例。实验表明该方法能有效提升VLA模型的前瞻性规划能力。原创 2026-02-16 12:11:48 · 3735 阅读 · 0 评论 -
PLD——自我改进的VLA:先通过离策略RL学习一个轻量级的残差动作策略,然后让该残差策略收集专家数据,最后蒸馏到VLA中
《PLD:基于残差强化学习的VLA模型自我改进方法》摘要 本文提出PLD(Policy Learning with Distillation)方法,通过三阶段流程实现视觉-语言-动作(VLA)模型的自我改进。针对高质量机器人数据获取困难、远程操作示范与真实状态分布不匹配等问题,PLD首先冻结VLA主干,利用样本高效的离线策略RL训练轻量级残差actor;然后采用混合rollout方案收集数据,既保留基础策略访问状态又捕获恢复行为;最后通过监督微调将多任务数据蒸馏回基础模型。该方法在LIBERO基准上实现了超原创 2025-12-15 23:38:47 · 3791 阅读 · 1 评论 -
GR-RL——首个让机器人系鞋带的VLA:先离线RL训练一个“分布式价值评估器”以做任务进度预测,后数据增强,最后在线RL
摘要:GR-RL提出了一种结合视觉语言动作模型(VLA)与强化学习(RL)的新方法,以解决机器人精细操作中的两大挑战:毫米级精确控制和长时序任务鲁棒性。该方法通过三阶段训练流程:1)利用离线RL筛选优质人类示范数据;2)采用镜像对称性进行数据增强;3)通过在线RL在潜在空间进行结构化探索优化。实验表明,这种混合训练范式显著提升了如穿鞋带等高精度灵巧操作任务的性能,解决了传统VLA策略在训练-部署不匹配和次优示范影响下的局限性。原创 2025-12-08 14:57:55 · 4056 阅读 · 0 评论 -
π∗0.6——通过RL框架RECAP微调流式VLA π0.6:先基于示教数据做离线RL预训练,再SFT(即IL微调),最后在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)
摘要: π0.6是PI公司提出的新一代视觉-语言-动作(VLA)模型,通过强化学习(RL)从自主经验中提升性能。其核心框架RECAP结合了离线RL预训练、在线数据采集与专家干预,利用分布式价值函数评估任务进展,并通过优势条件策略优化动作选择。实验表明,该方法在复杂任务(如折叠衣物、制作咖啡)中使吞吐量提升2倍以上,失败率降低50%,实现了长时间稳定运行。相比传统模仿学习或策略梯度方法,π0.6通过端到端优势条件化处理异构数据,解决了VLA模型在真实场景中强化学习的可扩展性与稳定性问题,为通用机器人学习提供了原创 2025-11-18 23:13:09 · 13675 阅读 · 9 评论 -
πRL——首个在线RL微调流式VLA π0/π0.5的框架:通过Flow-Noise和Flow-SDE实现精确对数似然估计,全面提升性能
本文探讨了工业机械臂智能化改造的最新方法,重点介绍了首个在线强化学习(RL)微调流式视觉语言代理(VLA)的框架πRL。针对传统自回归VLA在连续动作控制上的局限性,πRL创新性地提出了Flow-Noise和Flow-SDE两种解决方案,克服了流匹配中对数似然估计的难题。该框架通过将强化学习与基于流的VLA架构(如π0和π0.5)相结合,实现了高精度且泛化的机械臂控制能力,为工厂智能化改造提供了新的技术路径。研究表明,RL微调VLA的方法正在成为工业机械臂智能化的主流方向。原创 2025-11-10 13:08:11 · 6319 阅读 · 2 评论 -
ConRFT——Consistency Policy下RL微调VLA的方法:先通过示教数据离线微调(Cal-QL的Q损失基础上引入BC损失),后在线RL微调(引入RLPD的新老数据对称采样及人工干预)
本文探讨了具身智能中模仿学习(IL)、视觉语言模型(VLA)和强化学习(RL)的融合趋势。研究表明,单纯IL学习速度快但精准度不足,单纯VLA泛化性强但缺乏精准控制,单纯RL精准度高但样本效率低。作者提出ConRFT方法,通过两阶段一致性策略强化微调:先利用少量演示数据离线微调(Cal-ConRFT),再结合人机协同(HIL)在线微调(HIL-ConRFT)。该方法在保持VLA通用能力的同时,通过统一训练目标整合BC损失和Q学习,有效解决了接触丰富任务中的样本效率和安全探索问题,为工业机械臂智能化提供原创 2025-09-10 00:32:23 · 4895 阅读 · 0 评论 -
知识蒸馏RLDG:先基于精密任务训练RL策略(HIL-SERL),得到的RL数据去微调OpenVLA,最终效果超越人类演示数据
论文《RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning》提出通过强化学习生成高质量训练数据,以提升通用机器人策略(如OpenVLA/Octo)在精密操作任务中的性能。传统基于人类演示的微调存在精度不足、数据不一致等问题,而RLDG先训练任务专用RL策略生成优化轨迹,再蒸馏至通用模型,实验显示其成功率比人类演示高30%,泛化能力提升50%。该方法结合了RL的精确控制与基础模型的泛化优势,尤其在接触密集型任务原创 2025-08-30 12:09:49 · 4583 阅读 · 0 评论 -
RaC——挂衬衫且打包外卖盒:如果机器人将失败,则人类让其先回退后纠正,以减缓IL中的误差累积(让数据的增长对任务促进的效率更高)
《RaC:通过恢复与纠正扩展机器人长时任务学习能力》摘要 CMU研究者提出RaC训练范式,针对模仿学习在长时任务中的局限性。该方法在预训练基础上引入人类干预数据收集:当策略即将失败时,操作员首先回滚机器人至安全状态,再提供纠正片段。这种结构化干预包含两种关键行为:(1)恢复至分布内状态;(2)执行子任务纠正。实验表明,RaC能显著提升策略鲁棒性,在接触丰富的灵巧操作任务中实现10倍效率提升。该方法创新性地将恢复行为视为可学习技能,无需修改基础模仿学习框架,仅通过优化数据构成即可突破传统模仿学习的性能瓶颈。研原创 2025-10-05 00:43:33 · 4688 阅读 · 1 评论 -
iRe-VLA——RL微调VLA:先SFT、后在线RL,最后结合“离线演示和在线成功数据”对VLA做SFT(含GRAPE的详解)
过去的这两年,工作之余,我狂写大模型与具身的文章,加之具身大火,每周都有各种朋友通过CSDN私我帮忙:要么是做科研想复现,要么是工厂想做自动化生产线的智能升级,要么是想通过机械臂/人形解决各种业务场景问题让我感慨:二零一一年,因为算法,首次有「天下无人不识君」的感觉,过去这两年,因为大模型和具身机器人,再次有了这感觉具身的论文解读过很多之后,便会发现整个具身的技能图谱大概如下所示(建议按照从下至上的顺序看)其中,action head有基于LSTM的基于diffusion model的。原创 2024-12-31 00:02:11 · 12024 阅读 · 0 评论 -
TA-VLA——将关节力矩反馈融入VLA中:无需外部力传感器,即可完成汽车充电器插入(且可多次自主尝试,已开源)
本文探讨了具身智能开发的前景,重点解读了TA-VLA模型在机械臂精密操作中的应用。研究表明,通过将关节力矩信号集成到视觉-语言-动作模型中,可显著提升机械臂对物理接触的感知能力。作者系统分析了力矩信号在模型中的三种集成维度(时序、位置、方式),发现将历史力矩编码为解码器的单一token效果最佳。实验证明,这种设计在10项任务中优于传统VLA方法,特别是在充电器插拔等精细操作任务中,能准确区分接触状态。该研究为工业智能化提供了重要技术支撑,推动机器人从自动化向智能化的升级原创 2025-09-13 23:36:30 · 5375 阅读 · 5 评论 -
TactileVLA——将触觉作为原生模态引入VLA:触觉参与动作生成,且根据触觉推理出合适的力度大小,以高成功率搞定充电器和USB插拔
摘要: Tactile-VLA是一种融合视觉、语言与触觉的多模态机器人操作框架,通过触觉感知提升接触丰富任务的执行精度。该模型基于π0架构改进,引入触觉编码器和混合力控机制,将语言指令(如"轻柔地")直接映射为物理力目标。通过端到端流匹配训练,模型展现了零样本泛化能力,包括力控指令迁移、物体自适应抓握及基于触觉反馈的自主纠错。实验表明,Tactile-VLA在插拔、装配等需精细力控的场景中优于传统视觉-语言模型,实现了语义理解与物理交互的深度结合。原创 2025-08-18 17:25:38 · 4476 阅读 · 0 评论 -
ForceVLA——将具备力感知的MoE整合进π0的动作专家中:从而融合“视觉 语言 力反馈”实现精密插拔(非夕集成了六维力传感器,已开源)
摘要:ForceVLA是一种新型视觉-语言-动作(VLA)模型,通过引入力感知专家混合(MoE)模块,将6D力反馈与视觉语言信息融合,显著提升了机器人在精密插拔等接触密集型任务中的表现。相比现有主要依赖视觉的VLA模型,ForceVLA能动态感知任务各阶段的力变化,实现更精确的物理交互。该模型在π0框架基础上,通过SigLIP视觉语言编码器处理多摄像头输入,并结合本体感知和力觉信息,利用条件流匹配生成动作轨迹。实验表明,ForceVLA能有效应对视觉模糊场景,在多种插拔任务中展现出更强的鲁棒性和适应性。原创 2025-08-13 00:00:46 · 4365 阅读 · 2 评论 -
实时动作分块RTC——为解决高延迟,让π0.5也可以点燃火柴、插入网线:执行当前动作分块时生成下一个分块,且已执行的冻结并通过“图像修复”引导新块的生成
摘要 Physical Intelligence公司提出了一种实时动作分块技术(RTC),解决了视觉-语言-动作模型(VLA)在高精度任务中的延迟问题。该技术将异步动作分块建模为修补问题,在执行前一个动作块的同时生成下一个兼容的动作块,有效避免了传统分块方法在切换点产生的不连续性。RTC适用于基于扩散或流的可变长度动作模型,无需改变现有训练流程。实验表明,该方法能实现连续稳定的控制信号,支持如点燃火柴、插入网线等高精度操作任务,突破了VLA在实时控制中的性能瓶颈。该成果发表于2025年6月,为VLA在具身智原创 2025-07-15 16:43:07 · 9395 阅读 · 14 评论 -
Manual2Skill——让VLM从装配手册中提取装配步骤,随后做姿态估计,最终完成IKEA家具的自动组装(含IKEA-Manuals的详解)
Manual2Skill:基于视觉语言模型的家具自动装配框架 摘要:新加坡国立大学等机构提出的Manual2Skill框架,通过视觉语言模型(VLM)理解家具装配手册,实现自主机器人装配。该框架首先利用GPT-4o解析手册中的抽象示意图,生成分层装配图;然后结合部件点云和手册图像预测6D装配位姿;最后通过运动规划生成无碰撞装配轨迹。实验表明,该方法能有效处理复杂的长时序装配任务,显著减少对示范数据的依赖。相比传统方法局限于简单桌面任务,Manual2Skill突破了复杂家具装配的挑战,为智能制造提供了新思路原创 2025-08-02 01:14:51 · 4578 阅读 · 7 评论 -
VITAL——结合“带语义增强的ResNet视觉、触觉、RL残差”的适用于「电源插拔」的可泛化策略:先VLM定位、后执行在线残差RL以微调离线基础BC策略(MLP作为动作头)
摘要:VITAL框架通过两阶段策略(全局视觉定位+局部触觉操作)解决精密操作任务泛化难题。第一阶段利用视觉语言模型进行目标定位,第二阶段复用自中心视觉与触觉的局部策略完成毫米级操作。该方案结合模仿学习(32次演示)与强化学习微调(45分钟),通过语义数据增强保持泛化性,显著降低对场景变化的敏感性。实验显示,该方法在USB插入等任务中兼顾精度与跨环境适应性,为机器人精细操作提供新思路。(149字)原创 2025-07-03 17:01:43 · 5017 阅读 · 0 评论 -
Q-chunking——带有动作分块的强化学习:基于人类演示,进行一定的连贯探索(且可做到无偏的n步价值回溯)
UC伯克利提出Q-chunking方法,通过动作分块改进离线到在线强化学习。该方法在动作序列层面运行RL策略,预测并执行未来h步动作,利用时序差分训练评估器进行无偏的n步价值回传。研究显示,这种方法能加速价值传播、保持无偏估计,同时通过行为约束利用离线数据中的时序连贯动作序列,有效缓解探索难题。相比分层RL,Q-chunking简化了优化过程,在保持探索优势的同时提升了样本效率。相关代码和论文已在GitHub和arXiv公开。原创 2025-07-16 16:05:39 · 4756 阅读 · 0 评论 -
WSRL——热启动的RL如何20分钟内控制机器人:先离线RL预训练,之后离线策略热身(模拟离线数据保留),最后丢弃离线数据做在线RL微调
毕竟未来一两月,我司长沙分部的规划是对于机械臂,考虑IL + RL结合下的方法,继续优化USB插拔、电源插拔等各种插拔场景对于人形,继续unitree_IL_lerobot,以及全身遥操、跳舞、展厅讲解针对各种插拔场景,7.4日下午,我司长沙分部同事文弱发我了一个介绍WSRL的X链接,我一看,挺不错,很有价值,也很有意义,后续准备试下,故本文先解读下一为指导将来的实践,二为分享,与更多有志于在线RL方向的同仁多交流(欢迎私我一两句的简介,邀你加入:七月:HIL-SERL/WSRL/VITAL交流原创 2025-07-06 23:23:58 · 4309 阅读 · 3 评论 -
HIL-SERL——结合“人类离线演示、在线策略数据、人工在线干预”的RL方法:直接真实环境中RL开训,可组装电脑主板和插拔USB
机器人强化学习任务可以通过一个来定义,其中是状态观测(例如,结合机器人的本体状态信息的图像)是动作(例如,期望的末端执行器扭转)是初始状态的分布,是依赖于系统动态的未知且可能是随机的转移概率而是奖励函数,编码任务最优策略是最大化奖励的累计期望值的策略,即,其中期望是通过关于初始状态分布、转换概率和策略在实践中,策略通常建模为由神经网络参数化的高斯分布为了实现机器人任务的强化学习算法,必须仔细选择合适的状态观察空间和动作空间。原创 2024-10-31 17:09:18 · 13679 阅读 · 11 评论 -
SERL——针对真机高效采样的RL系统:基于图像观测和RLPD算法等,开启少量演示下的RL精密插拔之路(含插入基准FMB的详解)
本文系统梳理了机器人强化学习框架SERL及其相关技术发展脉络。研究始于RLDG复现需求,回溯至其基础HIL-SERL框架,进而解析其核心算法RLPD(2023),并延伸至SERL(2024)前身工作。文章重点分析了SERL框架的创新性:1)整合了高样本效率的RLPD算法;2)提供图像观测兼容的奖励指定方法;3)实现自动任务重置机制;4)开发通用机器人适配接口。研究特别强调,SERL通过精心设计的实现细节(如阻抗控制器、高UTD比训练)在15-60分钟内完成复杂操作任务训练,验证了现有算法经优化后可达实用效率原创 2025-09-01 12:39:10 · 4610 阅读 · 0 评论 -
Calibrated Q-learning(简称Cal-QL)——为高效在线微调而对“离线RL预训练”做校准:让学到的Q值有上界(保持标准CQL已做到的相对保守),但保守得有底线(不能过分保守)
本文探讨了Cal-QL算法在离线强化学习预训练和在线微调中的应用。该算法通过校准Q值,解决了传统方法中因保守性导致Q值被过度压低的问题。Cal-QL确保学到的Q值既作为最优策略的下界,又作为行为策略的上界,避免在线微调初期出现"遗忘"现象。相比现有方法,Cal-QL能更好地保留离线策略的优势,同时在在线阶段实现高效学习。这种校准方法显著提升了从离线预训练到在线微调的过渡效率,为强化学习提供了一种更稳定的训练范式。原创 2025-12-16 19:06:50 · 3756 阅读 · 0 评论 -
RLPD——利用离线数据实现高效的在线RL:不进行离线RL预训练,直接应用离策略方法SAC,在线学习时对称采样离线数据
摘要:本文介绍了两项强化学习前沿工作RLPD和RLDG。RLPD提出了一种高效融合离线数据的在线强化学习方法,通过"对称采样"机制(50%在线数据+50%离线数据)和层归一化技术,有效缓解了价值函数过度外推问题,在多个基准测试中实现了SOTA性能。RLDG则采用知识蒸馏框架,先训练精密任务RL策略生成数据,再微调视觉语言模型,性能超越人类演示数据。两项工作分别从数据利用效率和知识迁移角度推进了强化学习在实际场景中的应用,特别是在样本效率、稳定性和泛化能力方面取得重要突破。(149字)原创 2025-08-30 23:33:16 · 5219 阅读 · 0 评论
分享