- 博客(104)
- 收藏
- 关注
原创 cuRobo V2 入门教程(一):基于深度融合距离场的动态感知运动生成方法,适用于高自由度机器人
cuRoboV2提出了一种统一的高性能机器人运动生成框架,通过三大创新解决现有方法的局限性:1)基于B-样条的轨迹优化确保运动平滑性和扭矩限制;2)GPU加速的感知管道实现快速稠密距离场构建,比现有方法快10倍且内存消耗降低8倍;3)可扩展的GPU计算模块支持高自由度机器人,实现高达61倍的加速。实验表明,该系统在3kg负载下成功率高达99.7%,在48自由度人形机器人上实现99.6%的无碰撞逆运动学,显著优于现有方法。此外,代码重构使大型语言模型能编写73%的新模块,展示了人机协作开发机器人系统的潜力。
2026-05-07 07:30:00
526
1
原创 MolmoAct 2:面向真实世界中工作的机器人的开放式基础架构
《MolmoAct2:开源机器人基础模型的重大突破》 研究人员发布了MolmoAct2机器人基础模型及其配套数据集,标志着自主机器人技术的重大进展。该模型在行业基准测试中表现优于现有专有系统,运行速度比前代快37倍,并首次内置了双臂协同操作能力。配套发布的MolmoAct2-BimanualYAM数据集包含720小时训练视频,是目前最大的开源双臂机器人数据集。 MolmoAct2采用创新的自适应深度推理机制,在保持高效的同时提升了3D空间理解能力。评估显示,该模型在13项具身推理基准测试中平均得分63.8,
2026-05-07 07:30:00
455
原创 mink 入门教程(一)MuJoCo 微分运动学库
Mink是一个基于MuJoCo物理引擎的微分逆运动学库,用于实时计算满足任务空间目标和约束条件的关节速度。它将问题建模为二次规划,支持多任务组合和优雅的约束处理。Mink采用物体坐标系表示速度和雅可比矩阵,提供配置封装来处理运动学量和积分。通过FrameTask可定义末端执行器的目标姿态,并控制收敛速度。示例展示了如何加载模型、设置目标姿态并运行IK循环,最终输出位置误差。该库适用于运动规划、机器人控制和运动重定位等领域。
2026-04-07 07:30:00
529
原创 SOMA 入门教程(一)统一的参数化人体模型
本文提出SOMA框架,旨在解决现有参数化人体模型(如SMPL、SMPL-X、MHR等)之间的异构性问题。SOMA通过三个抽象层实现统一表示:1)网格拓扑抽象层实现顶点级映射;2)骨骼抽象层通过闭式运算适配骨骼系统;3)姿态抽象层支持异构运动数据的转换。该方法将适配器复杂度从O(M²)降至O(M),支持端到端可微分处理,并兼容多种主流人体模型。实验表明,SOMA能有效整合不同模型的优势,为人体重建、动画制作等任务提供统一解决方案。
2026-03-21 07:00:00
593
原创 Kimodo 入门教程(二)英伟达开源人形机器人动捕数据集训练运动学动作扩散模型
Kimodo是一款基于700小时光学动作捕捉数据训练的运动学动作扩散模型,支持生成高质量的人体和机器人3D动作。其核心功能包括: 多模态控制:通过文本提示和运动学约束(关键帧、路径、末端执行器等)精确控制动作生成 交互式演示:提供网页端时间轴编辑器,支持实时3D可视化、多角色生成和约束编辑 跨平台支持:包含命令行接口和Python API,支持SOMA/G1/SMPL-X三种骨骼格式输出 高级配置:支持分离式无分类器引导,可调节文本/约束权重平衡 该工具适用于数字人动画、机器人运动规划等场景,提供商用友好的
2026-03-19 07:00:00
1057
原创 LeRobot 官方论文:一个用于端到端机器人学习的开源库
本文介绍了一个名为LeRobot的开源库,旨在解决机器人学习领域的碎片化问题。该库提供了端到端的技术栈,包括统一的机器人中间件API、标准化的数据集格式(LeRobotDataset)、优化的推理栈以及多种最先进机器人学习算法的实现。LeRobot支持多种低成本开源机器人平台(如SO-10X、ALOHA-2等),通过共享中间件实现便捷的遥操作和数据收集。其数据集格式已广泛应用于社区,截至2025年9月已有16,000多个数据集公开共享。该库还支持流式处理大规模数据,降低了研究门槛。在模型方面,LeRobot
2026-03-19 07:00:00
764
原创 Kimodo 入门教程(一)英伟达开源人形机器人动捕数据集训练运动学动作扩散模型
Kimodo是一个基于700小时商用光学动作捕捉数据集训练的运动学动作扩散模型,能够生成高质量的人体和机器人3D动作。该模型支持通过文本提示和多种约束条件(如关键帧、末端执行器位置等)进行控制,并提供数字人类和类人机器人两种模型变体。安装方式包括软件包安装和源代码安装两种,需要配置HuggingFace令牌以访问文本编码器。推荐使用GPU加速,最低需要17GB显存。项目提供命令行生成和交互式演示两种使用方式,演示程序支持时间轴编辑和实时3D可视化。模型分为商用友好版和受限版,其中SMPL-X版本需要额外申请
2026-03-18 12:23:18
1803
原创 Newton 英伟达最新开源仿真器增强接触感知操作与移动能力
NVIDIA推出开源物理仿真引擎Newton 1.0,通过GPU加速实现机器人仿真领域的突破。该引擎整合了MuJoCo、Kamino等多种求解器,支持刚体、可变形体和颗粒材料的高保真仿真,并与IsaacLab/IsaacSim深度集成。Newton采用模块化架构,提供稳定的API接口,支持OpenUSD等主流机器人描述格式,并创新性地实现了基于SDF的碰撞检测和流体弹性接触建模。工业应用案例显示,Newton在电子装配线仿真和电缆操作等复杂任务中展现出卓越性能。该引擎由NVIDIA联合Google Deep
2026-03-18 07:00:00
992
原创 NVIDIA GR00T SONIC - 人形机器人强化学习全身控制入门教程(一)
SONIC 是一个类人行为基础模型,它为机器人提供了一套从大规模人类动作数据中学习而来的核心运动技能。与为每个动作单独构建控制器不同,SONIC 将动作追踪作为可扩展的训练任务,因此单一套统一策略即可产生自然的全身运动,并支持多种多样的行为。 🎯 主要特点:🚶 自然的全身运动(行走、爬行、动态动作)🎮 支持实时 VR 遥操作🤖 高级规划与交互的基础📦 即用型 C++ 推理栈
2026-03-16 07:00:00
738
2
原创 英伟达 DGX Spark & Reachy Mini 入门教程(一)
英伟达在2026年CES上发布多款开放模型,包括Nemotron推理LLM、Isaac GR00T VLA和Cosmos世界模型,助力开发者构建个性化AI代理。文章详细介绍了如何通过DGXSpark和Reachy Mini机器人打造办公助手,涵盖材料准备(推理/视觉模型、文本转语音服务)、智能体构建(NeMo Agent Toolkit框架)、工具调用和路由策略实现。系统支持本地/云端部署,提供语音交互、视觉识别和动作执行功能,并保持完全开源可定制。最后给出运行演示的终端配置步骤和测试用例,鼓励开发者在此基
2026-01-07 07:30:00
2662
原创 NVIDIA Isaac Lab-Arena 通用人形机器人策略评估
摘要:NVIDIA推出开源机器人策略评估框架IsaacLab-Arena,旨在简化多样化任务的环境构建与大规模并行评估。该框架由模块化组件构成,支持跨机器人、物体和场景的快速切换,并集成数据生成与训练流程。目前已与Lightwheel等合作伙伴开发250+任务,并整合至HuggingFace平台。未来计划增强自然语言任务配置和神经模拟功能。框架支持端到端工作流,包括环境创建、策略训练和评估环节,开发者可通过GitHub参与共建生态。
2026-01-07 07:30:00
1673
原创 mjlab 入门教程(一)MuJoCo 人形机器人强化学习训练 sim-to-real 部署框架
摘要:mjlab是一个结合IsaacLab API与MuJoCo简洁性的GPU加速机器人仿真框架,专为强化学习和机器人研究设计。它提供快速安装(支持uv、pip、conda和Docker)、核心功能(域随机化、NaN守护、观测历史/延迟、执行器/传感器系统)以及从IsaacLab的迁移指南。相比IsaacLab,mjlab更轻量、启动更快,直接构建在MuJoCo Warp上,避免了Omniverse开销。其哲学强调裸机性能、开发者体验和核心领域专注,适合需要快速迭代和直接MuJoCo控制的用户,而Isaac
2026-01-05 07:30:00
2598
原创 LeRobot 入门教程(十七)NVIDIA IsaacLab Arena 集成
LeRobotEnvHub现已集成IsaacLabArena实现GPU加速仿真,支持GR1/G1/伽利略人形机器人实体和多种操作任务。安装需满足CUDA GPU、Ubuntu系统和IsaacSim 5.1.0要求,通过conda环境配置依赖项。系统提供SmolVLA和PI0.5等预训练策略评估功能,支持视频录制和并行环境配置。环境配置选项涵盖机器人实体、任务类型、观测维度等参数,并包含针对CUDA内存、视频录制等常见问题的解决方案。此外,LightWheel AI还通过LW-BenchHub引入了包含268
2026-01-05 07:30:00
1202
原创 nvblox(torch)入门教程(一)
摘要:nvblox是NVIDIA开发的GPU加速实时3D重建库,支持机器人应用场景。该库提供Python(nvblox_torch)和C++两种接口,支持x86和Jetson平台。安装方式包括pip快速安装(推荐)和Docker内源码编译两种方案,支持Ubuntu 20.04-24.04及CUDA 11.4-12.8环境。核心功能包含深度/彩色帧融合、网格生成和ESDF查询,通过优化CUDA实现高性能重建。文档提供SUN3D数据集示例演示完整工作流程,并包含多GPU架构编译等高级选项。相关研究论文已发表于a
2025-12-22 07:30:00
962
原创 Fast-FoundationStereo 入门教程(一):实时零样本立体匹配
本文提出Fast-FoundationStereo架构,在保持零样本泛化能力的同时实现实时性能。通过知识蒸馏压缩混合骨干网络、块级神经架构搜索优化成本滤波设计、结构化剪枝消除冗余等策略,使速度提升10倍。创新性地引入自动伪标签管道,整合140万组真实场景立体图像对补充训练数据。最终模型在实时运行时约束下达到与基础模型相近的准确率,为实时立体匹配树立新标杆。
2025-12-21 07:30:00
637
原创 cuMotion 入门教程(一)面向机器人学的GPU加速运动生成技术
NVIDIA cuMotion是一款高性能机器人运动生成库,专注于机械操作任务,利用GPU加速技术提升性能。开发者预览版支持运动学/逆运动学、碰撞感知路径规划、轨迹优化等功能,兼容任意自由度机器人。该库提供C++和Python接口,支持从URDF/XRDF文件加载机器人模型,包含世界建模、碰撞检测等工具。教程详细介绍了安装配置、机器人描述加载、运动学计算、世界建模、逆运动学求解以及轨迹优化等核心功能。cuMotion整合了Lula和cuRobo库的技术优势,将成为Isaac ROS的核心组件,适用于工业机器
2025-12-21 07:30:00
2141
原创 基于采样优化的双臂操作并行化物理仿真器
本文提出一种基于GPU加速物理仿真的双臂操作规划方法。针对端到端学习泛化性差的问题,采用模型预测路径积分控制(MPPI)框架,通过MuJoCo仿真器并行评估数千种动作序列。核心创新包括:1)将二次规划嵌入MPPI采样流程以提高轨迹平滑性;2)设计11项任务特异性代价函数引导双臂协同操作;3)在PerAct2基准测试的复杂变体(如障碍环境中托盘搬运)验证有效性。实验表明该方法在商用GPU上可实现实时性能,并通过统计分析量化了采样复杂度与鲁棒性,为仿真到现实迁移提供了可行路径。
2025-12-09 07:30:00
1652
原创 LeRobot 宇树人形机器人 G1 部署 GR00T 运动策略
本文详细介绍了Unitree G1人形机器人的完整设置流程。首先通过以太网连接机器人并进行SSH访问,然后配置WiFi网络实现无线连接。在机器人端安装LeRobot软件并运行服务器程序,最后在控制端配置IP地址并运行GR00T移动控制系统。指南涵盖了29自由度和23自由度版本G1机器人的配置方法,支持通过WiFi进行远程策略部署,提供双足行走与平衡控制功能,并详细说明了遥控器操作方式。
2025-12-08 07:30:00
2118
1
原创 ProtoMotions 3 入门教程(一)开源 GPU 加速人形机器人强化学习仿真训练框架
ProtoMotions是一个基于GPU加速的仿真与学习框架,专为训练物理模拟的数字人类和类人机器人设计。该框架支持多种仿真后端(IsaacGym、IsaacLab、Genesis和Newton),提供模块化设计、丰富工具集和前沿算法(如MaskedMimic、AMP等)。安装过程需根据不同仿真器创建独立虚拟环境。框架包含预训练模型、AMASS数据处理工具和训练评估流程,支持多机器人形态(SMPL、Unitree G1/H1等)和大规模训练任务。通过Weights & Biases实现训练监控,采用
2025-12-07 07:30:00
1346
原创 LeRobot X-VLA:首个适用于任意机器人、任意任务的软提示机器人基础模型
X-VLA是一种基于软提示的视觉-语言-动作模型,通过可学习嵌入向量编码不同机器人配置,实现跨平台统一控制。该框架采用两阶段训练:先在29万次多平台任务中学习通用策略,再通过微调少量参数(仅1%)适配新机器人。实验表明,0.9B参数的X-VLA在6个仿真和3个真实平台上表现优异,如LIBERO任务达93%成功率,布料折叠任务100%完成。其核心创新是将硬件差异视为"任务",用软提示引导Transformer处理异构数据,为机器人基础模型提供可扩展方案。
2025-12-07 07:30:00
1184
原创 Holosoma 开源人形机器人强化学习训练部署框架
Holosoma是一个综合性人形机器人框架,支持强化学习策略的训练、部署和动作重定位。该框架兼容多种模拟器(IsaacGym、IsaacSim、MuJoCo等)和机器人(Unitree G1、Booster T1),提供运动控制和全身追踪功能。主要特性包括:跨模拟器训练评估、Wandb集成、多GPU支持、自定义奖励权重和观测噪声配置。推理模块支持实体机器人部署和MuJoCo仿真测试。动作重定位工具可将人体动作数据转换为机器人动作,支持单序列和批量处理。文档详细介绍了训练配置、评估方法和高级功能,如课程学习和
2025-12-04 07:30:00
1789
原创 LeRobot 入门教程(十六)Isaac Lab LeIsaac 叠衣服、夹橙子仿真环境
LeRobotEnvHub现已支持通过LeIsaac进行机器人模仿学习,提供摘橙子、搬立方体等日常任务仿真环境。用户可通过HuggingFace共享环境,使用一行代码加载任务,支持随机动作测试和远程操控。系统提供云端仿真方案,无需本地GPU即可运行。当前支持4种任务环境,通过make_env函数切换,其中折叠布料任务需先调用initialize()函数。该平台集成了数据采集、转换和训练全流程,为机器人学习提供便捷工具链。
2025-12-02 07:30:00
1432
原创 cuRobo 入门教程(三)基于CUDA的机器人运动规划加速库
cuRobo 是一款基于 CUDA 加速的库,包含一系列机器人算法,其运行速度远超现有利用并行计算的实现方案。cuRobo 目前提供以下算法:(1) 正向与逆向运动学,(2) 机器人与环境的碰撞检测(环境以长方体、网格和深度图像形式呈现), (3) 数值优化(支持梯度下降、L-BFGS与MPPI算法)(4) 几何规划(5) 轨迹优化(6) 运动生成(融合逆运动学、几何规划与轨迹优化,可在30毫秒内生成全局运动方案)
2025-11-27 07:30:00
979
原创 cuRobo 入门教程(二)基于CUDA的机器人运动规划加速库
cuRobo是一款基于CUDA加速的机器人算法库,提供正向/逆向运动学、碰撞检测、数值优化等核心功能,支持在NVIDIA Jetson Orin等平台上实现毫秒级运动规划。该库创新性地采用并行轨迹优化技术,结合nvblox工具实现深度摄像头避障功能,并通过多层ESDF结构处理动态障碍物。性能测试显示,在RTX 6000 Ada显卡上可实现99.85%的成功率,平均规划时间仅39毫秒。cuRobo还提供Python API支持神经网络集成,并具备批量环境处理能力,特别适用于工业机器人应用场景。最新版本通过算法
2025-11-26 07:30:00
1266
原创 cuRobo 入门教程(一)基于CUDA的机器人运动规划加速库
cuRobo是一款基于CUDA加速的机器人算法库,提供运动学计算、碰撞检测、轨迹优化等功能。该库采用并行优化技术,在GPU上实现高效运算,比现有方案快60倍。cuRobo支持多种机器人模型和环境表示,包含正向/逆向运动学、无碰撞轨迹生成、模型预测控制等核心算法,并可与IsaacSim等仿真平台集成。其特点包括:1) 支持多种碰撞检测方式(长方体/网格/深度图像);2) 提供批量环境处理和实时世界更新;3) 通过CUDA Graphs加速优化迭代;4) 在Jetson Orin等平台实现毫秒级运动规划。安装支
2025-11-25 07:30:00
1880
原创 RSL-RL:开源人形机器人强化学习控制研究库
摘要:RSL-RL是一款专为机器人领域设计的开源强化学习库,其核心特点是紧凑性、可修改性和高性能。该库聚焦PPO和BC两大主流算法,并整合了对称性增强、好奇心驱动等机器人专用技术。通过纯GPU训练优化,RSL-RL在大型仿真中展现出卓越的吞吐性能,已成功应用于腿足运动控制、全身协调等多个机器人研究场景。其轻量级架构包含运行器、算法和网络三个可独立修改的组件,支持TensorBoard等主流日志工具。该框架特别适合需要快速原型开发的机器人研究者,但不适用于通用机器学习基准测试。开源地址:https://git
2025-11-24 09:01:54
1633
原创 基于感知引导的多步骤精细操作任务与运动规划
摘要:本文探讨了结合感知与GPU加速的任务与运动规划(TAMP)技术在机器人长时域操作中的应用。介绍了三种创新框架:OWL-TAMP通过视觉语言模型将自然语言指令转化为机器人动作;VLM-TAMP融合视觉与语言理解优化多步骤任务规划;NOD-TAMP利用神经物体描述符实现对新物体的泛化操作。同时提出cuTAMP系统通过GPU并行化显著提升规划效率,以及Fail2Progress框架让机器人从失败中学习改进操作能力。这些技术共同解决了传统TAMP系统在动态环境中的适应性问题,为复杂机器人操作任务提供了高效解决
2025-11-24 07:30:00
903
原创 英伟达 Isaac Sim 5 最新版入门教程(一)Ubuntu 安装 Python ROS2 环境配置 云端部署
NVIDIA Isaac Sim™ 是基于Omniverse平台开发的机器人仿真工具,提供物理级虚拟环境用于AI机器人开发、测试和训练。主要功能包括:支持URDF/MJCF等格式的机器人导入;基于GPU的高保真PhysX引擎实现多传感器仿真;提供ROS2桥接和强化学习训练框架。支持Windows/Linux系统,推荐配置为RTX 4080显卡/16GB显存/64GB内存。安装方式包含工作站部署、容器化方案及Python环境集成,并针对不同ROS版本(Humble/Jazzy)提供兼容支持。该系统采用模块化设
2025-11-23 07:30:00
2102
原创 HMC:学习用于接触密集型移动-操作的异构元控制
本文提出异构元控制(HMC)框架,用于解决机器人复杂交互任务中的控制难题。HMC通过统一接口融合位置控制、阻抗控制和混合力-位置控制,支持扭矩空间的自适应动作融合。框架包含HMC控制器和HMC策略:控制器提供安全高效的遥操作与部署能力;策略采用预训练-微调范式,先利用大规模位置数据训练Transformer主模型,再通过专家混合机制整合精细化力感知数据。实验证明,该框架在擦桌、开门等高接触任务中性能提升超50%,显著优于纯位置控制方案。
2025-11-23 07:30:00
436
原创 Meta 最新开源 SAM 3 图像视频可提示分割模型
SAM3是一款突破性的图像和视频分割基础模型,支持文本、点、框、遮罩等多种提示方式。相比前代模型,SAM3新增了开放词汇分割能力,在包含27万概念的SA-CO基准测试中达到人类75%-80%水平。该模型基于400万自动标注概念的数据集,采用创新的存在标记和解耦检测器-追踪器架构,显著提升了语义区分能力。项目提供完整的推理和微调代码,支持图像批量处理和视频交互式追踪,可通过Hugging Face获取模型检查点。技术亮点包括文本提示分割、多目标追踪、实时掩膜优化等功能,为计算机视觉领域提供了强大的通用分割工具
2025-11-21 09:20:45
1383
1
原创 人形机器人大语言模型 pi*0.6(π*0.6):最新从经验中学习的VLA
摘要:本文介绍了一种名为Recap的机器人学习方法,通过示范训练、纠错指导和强化学习三个步骤提升机器人执行复杂任务的能力。研究显示,仅依靠模仿学习的机器人难以解决错误累积问题,而Recap方法通过价值函数可视化和优势条件策略训练,使π*0.6模型在咖啡制作、纸箱组装和衣物折叠等任务中的成功率提升超过90%,吞吐量翻倍。该方法突破了传统依赖人工演示的局限,通过自主经验学习实现机器人性能的持续优化,为未来机器人基础模型的发展提供了新方向。
2025-11-19 12:08:39
1294
原创 字节最新开源模型 DA3(Depth Anything 3)使用教程(一)从任意视角恢复视觉空间
本文介绍DepthAnything3(DA3)模型,一种能够从任意视觉输入中预测几何结构的创新解决方案。DA3采用Transformer骨干网络,通过统一的深度光线表示简化学习过程,支持单目/多视角深度估计、姿态估计和3D高斯预测等多项任务。模型系列包含基础版、度量级和单目专用版本,其中嵌套版本DA3NESTED-GIANT-LARGE表现最佳。代码库提供交互界面、CLI工具和多格式导出功能,支持模块化扩展。实验表明DA3在各项任务上超越现有模型,所有训练数据均来自公开学术数据集。
2025-11-16 07:30:00
2491
3
原创 MuJoCo Warp (MJWarp) GPU 加速入门教程
MuJoCoWarp(MJWarp)是NVIDIA与DeepMind联合开发的GPU加速版MuJoCo物理引擎,采用Warp语言实现并针对并行仿真优化。目前处于测试阶段,支持主流动力学模拟功能,但暂不支持插件、用户参数等特性。安装需CUDA 12.4+环境,提供批处理模拟功能,可通过nworld参数控制并行规模。性能优化建议包括使用CUDA图捕获、合理设置批处理参数(nconmax/njmax)以及调整求解器迭代次数。工具链包含测试脚本mjwarp-testspeed和交互式查看器mjwarp-viewer
2025-11-13 07:30:00
1131
原创 LeRobot 入门教程(十五)从Hub加载环境
EnvHub是一个基于HuggingFace Hub的环境共享框架,允许用户通过一行代码加载各类模拟环境。它支持将自定义环境以Git仓库形式发布到Hub,无需繁琐的打包过程即可实现环境共享。环境仓库需包含定义make_env函数的env.py文件,可选的requirements.txt等文件用于说明依赖关系。用户可通过指定仓库路径、版本和自定义文件来加载环境,建议固定到特定提交以确保安全性。EnvHub为环境作者提供了便捷的分发渠道,为研究人员提供了快速实验的平台,并为社区创建了协作环境。使用前需仔细审查代
2025-11-09 11:42:13
1202
原创 英伟达 GR00T N1.5 & LeRobot 训练、推理与部署
摘要:NVIDIA推出开源人形机器人基础模型GR00T N1.5,该模型基于视觉语言模型(VLM)和深度自编码器(DiT)构建,能处理多模态输入并执行操作任务。相比前代N1模型,N1.5通过冻结VLM参数、简化适配器结构等改进,显著提升了语言理解和泛化能力。模型支持在LeRobot框架中使用,需安装FlashAttention等依赖项。性能测试显示其在Libero基准测试中表现优异。开发者可使用真实或合成数据对模型进行微调,并将其部署到仿真或真实机器人环境中执行多样化任务。
2025-10-25 08:30:20
1480
原创 VLA-0:英伟达最新视觉-语言-动作模型
【研究摘要】本研究提出VLA-0,一种突破性的视觉-语言-动作模型设计方案。不同于现有方法需修改模型架构或引入特殊动作头,VLA-0创新性地将机器人动作直接编码为文本字符串,利用基础视觉语言模型(VLM)原生能力生成动作指令。实验显示,在LIBERO基准测试中,VLA-0超越所有同数据量训练模型,平均成功率94.7%,甚至优于依赖大规模预训练的先进模型。真实场景测试中,其表现较顶尖模型SmolVLA提升12.5%。关键创新包括:动作文本化编码、预测集成技术和掩码动作增强训练策略。该成果证明,简单设计通过精心
2025-10-20 07:30:00
1265
原创 LeRobot 入门教程(十四)Meta-World 机器人多任务与元强化学习操作仿真基准平台
Meta-World是一个开源机器人操作模拟基准平台,专注于多任务与元强化学习研究。该平台提供50项多样化任务(MT50套件),采用标准化评估协议测试算法泛化能力。LeRobot平台支持Meta-World任务评估,提供预处理数据集和训练工具。用户可通过命令行快速训练SmolVLA策略,并评估模型在简单、中等、困难等不同难度任务上的表现。文章还提供了兼容性问题和实用技巧建议,如使用完整MT50任务集测试泛化能力、采用one-hot任务条件化等。这些资源为研究人员开展机器人多任务学习提供了标准化实验环境。
2025-10-19 07:30:00
991
原创 VT-Refine:基于仿真微调的视觉-触觉反馈双臂装配强化学习
本研究提出VT-Refine框架,通过融合真实世界示范、高保真触觉仿真与强化学习,解决高精度双臂装配任务。方法分为两阶段:首先利用少量人类示范数据预训练视觉-触觉扩散策略;随后在数字孪生仿真环境中进行强化学习微调。关键创新包括:开发GPU加速的触觉仿真模块精确模拟压阻式传感器;采用基于点云的多模态表征实现无缝的跨领域迁移。实验表明,该方法在五个双臂装配任务中显著提升性能,触觉反馈使成功率提高40%。研究首次实现仿真环境中的大规模双臂视觉-触觉强化学习及sim-to-real迁移,为接触密集型任务提供了新解决
2025-10-19 07:30:00
1783
原创 LeRobot 机器人学习(Robot Learning)教程(二)经典机器人学
本文探讨了机器人学中基于学习的方法与传统动力学方法的对比与发展趋势。文章指出,传统方法依赖精确的动力学模型和大量人工调参,面临跨任务泛化能力弱、工程复杂度高、物理建模局限性等问题。随着机器学习技术的进步和机器人数据集的丰富,基于学习的方法展现出三大优势:(1)能够实现跨任务与实体的泛化;(2)降低对人类专业知识的依赖;(3)利用历史数据优化性能。文中以平面机械臂为例,分析了传统逆运动学方法的计算复杂性和环境适应性挑战,并指出基于学习的方案在处理高维感知输入、复杂接触动力学等方面具有明显优势。文章认为,结合物
2025-10-18 07:30:00
1038
原创 LeRobot 机器人学习(Robot Learning)入门教程(一)
本文介绍了现代机器人学习领域的发展现状与关键技术。随着机器学习进步和大规模机器人数据的普及,机器人技术正从传统基于模型的方法转向数据驱动的学习范式。HuggingFace开发的开源库lerobot实现了端到端集成,支持多种机器人平台和先进算法(强化学习、行为克隆等)。核心创新包括LeRobotDataset标准化格式,统一处理多模态时间序列数据,并支持高效批处理和流式访问。教程涵盖经典机器人学基础、强化学习原理、模仿学习技术和通用模型开发,结合代码示例展示如何构建适应多样化任务的机器人系统。该资源旨在为研究
2025-10-17 07:30:00
1934
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅