- 博客(1)
- 收藏
- 关注
原创 面向具身智能的DP
本文介绍了Diffusion Policy(DP)的基本概念和代码实现,重点分析了行为克隆(BC)在多模态动作分布中的局限性。文章指出,传统单步回归方法会因MSE损失函数导致动作平均化问题,而DP和Flow-based Learning(FL)通过学习动作分布可生成多样化的合理动作序列。详细讲解了DDPM(去噪扩散概率模型)的原理和实现步骤,包括噪声调度器、UNet模型结构及训练循环设计。文章还列出了学习DP需要掌握的8个核心知识点,并提供了相关参考材料,适合实习求职者、初学者系统学习扩散策略在机器人动作生
2026-05-24 23:17:27
568
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅