- 博客(9)
- 收藏
- 关注
原创 unitree_rl_lab代码分析
在source/unitree_rl_lab/unitree_rl_lab/tasks/locomotion/robots/g1/29dof/velocity_env_cfg.py中写了地形配置和奖励scale。奖励函数在source/unitree_rl_lab/unitree_rl_lab/tasks/locomotion/mdp/rewards.py。(PPO 的特点是:利用了裁剪(Clipping)机制,即使某个动作特别好,也只做一次适度的更新,防止网络“走火入魔”导致崩溃)。
2026-04-16 22:24:48
508
原创 RT-1模型架构(自用复习)
模型通过自注意力机制,无障碍地分析“苹果”(视觉令牌)、“捡起绿色海绵”(语言令牌)和“先前手的位置”(动作令牌)之间的关系,然后预测出。:对于机械臂的7个维度(x, y, z, 横滚,俯仰,偏航,夹爪)和底盘的3个维度(x, y, θ),分别将其可能的取值范围均匀划分为256个区间。是一个可学习的模块,它可以从EfficientNet输出的81个视觉令牌中,动态地筛选出最相关的少数几个(如8个),极大提升了处理效率。目标:将连续的、高精度的机器人动作,转化为一个离散的、有限的分类问题。
2026-01-14 16:45:53
1161
原创 VAE原理
我们之前说 Loss =重构误差 (Reconstruction)KL 散度 (Regularization)。如果只有重构误差(没有 KL)会怎样?Encoder 会作弊。为了让 Decoder 恢复得最准,Encoder 会把每张图的方差 $\sigma$ 弄成 0,把 $\mu$ 弄得离得非常远。比如:狗的坐标在 10000,猫的坐标在 -10000。结果:这就不叫“分布”了,这就退化回了普通的 AutoEncoder。
2026-01-07 20:29:17
704
1
原创 ACT复现仅复习自用
我们在下面的示例中使用``sim_transfer_cube_scripted``任务。另一个选项是``sim_insertion_scripted``。
2025-12-30 16:30:23
310
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅