- 博客(123)
- 问答 (1)
- 收藏
- 关注
原创 从VAE到LeWM:具身智能世界模型学习路线与踩坑全记录
本文系统梳理了从VAE到LeWM的具身智能世界模型学习路径,揭示了核心矛盾在于"想象精度"与"表征崩溃"的博弈。作者通过复现VAE-MNIST生成实验,深入解析LeWM架构原理(含SIGReg防崩溃机制),并对比RAW-Dream、WoG等前沿模型特性。关键发现包括:VAE需KL Warm-up防后验坍塌、LeWM通过正态性约束保持表征区分度、规划必须采用MPC策略防误差累积。实践层面提出"5天必修+进阶选修"的学习路线,强调可视化验证和数学推导的重要性,为世界模型研究者提供了翔实的理论指导与工程避坑指南。
2026-07-31 16:47:56
344
原创 具身世界模型的三重进化:RAW-Dream、WoG 与 WALL-WM 对比解读
摘要: 本文对比了三种具身智能世界模型的创新范式:RAW-Dream通过任务无关的扩散模型生成高保真未来帧,为视觉-语言-动作策略提供无限训练数据;WoG在结构化条件空间中解耦场景变量,支持精细化干预与反事实推理;WALL-WM将状态与动作提升至事件层级,通过语义化抽象实现长程任务规划。三者分别从数据增强、解耦建模和分层抽象角度突破世界模型的边界,共同推动具身智能在开放环境中的想象、推理与规划能力。技术图示显示,这些方法在建模粒度、任务适配和动作表示上形成互补,未来融合多范式优势或将成为发展方向。
2026-07-29 00:17:11
363
原创 LeWM世界模型全解:只用两项损失,根治世界模型表征崩溃问题
LeWM世界模型:用两项损失根治表征崩溃问题 LeWM(Learned World Model)通过创新性SIGReg正则损失,从理论层面解决了自监督世界模型训练中的表征崩溃问题(即编码器将不同输入映射为相同常数特征)。相比现有方案(如启发式约束、多损失平衡或JEPA的EMA黑盒技巧),LeWM仅需预测损失+SIGReg正则两项损失,强制潜特征服从高维正态分布,避免退化。其优势包括: 理论完备:基于Cramér–Wold定理,通过随机投影正态检验约束特征分布; 训练稳定:超参数极少(仅投影数M和权重λ),无
2026-07-24 00:03:21
342
原创 世界模型前置基础:VAE原理详解与MNIST图像生成实战
本文系统讲解了变分自编码器(VAE)的原理与实现,重点包括: 核心原理:VAE通过概率化潜空间(高斯分布参数)和ELBO优化,解决了普通自编码器无法生成新样本的问题。关键创新是重参数化技巧和KL散度约束,使潜空间连续规整。 数学推导:通过Jensen不等式和似然分解两条路线,详细阐释ELBO下界的构建逻辑,明确重建损失与KL损失的作用。 工程实践:基于PyTorch实现U-Net风格的VAE,适配MNIST生成任务,包含模型架构设计、损失函数优化(如logits输出、KL warm-up)等实战技巧。 应用
2026-07-21 00:05:54
332
原创 CCswitch和Codex下载
本文介绍了Codex和CCswitch的下载与配置方法。Codex是OpenAI旗下的工具,但使用需连接ChatGPT或API key。CCswitch作为开源项目,可帮助管理多个AI编程工具的配置,支持国内API key接入。文章详细展示了CCswitch的下载步骤,并以deepseek为例演示了如何添加供应商和API key,包括启用本地路由等设置。最后指导用户重启Codex以完成配置,并提供了相关参考视频链接。全文通过图文结合的方式,为开发者提供了实用的工具配置指南。
2026-07-02 00:46:05
425
原创 Datawhale之春晚机器人跳舞复刻
本文摘要:Datawhale项目旨在将文本动作描述或视频转换为机器人动作文件(robot_motion*.pkl)并进行可视化展示。主要流程包括Prompt/Video输入、PromptHMR处理、SMPL-X转换、GMR生成最终机器人动作。提供服务器租用方案和详细环境部署指南,包含GMR和PromptHMR环境配置、模型权重下载等关键步骤。项目支持多人轨迹处理和多机器人MuJoCo录制,并给出常用命令示例。特别说明在4090显卡场景下的环境配置注意事项,以及模型权重下载的两种方案。
2026-03-07 21:20:41
571
原创 一文搞定 GitHub SSH Key:生成、配置、好处全攻略
本文详细介绍了如何配置GitHub SSH Key,实现免密安全认证。主要内容包括:SSH协议的四大优势(免密登录、安全性高、稳定省心、支持自动化);Git身份配置步骤;检查本地SSH Key;生成RSA密钥对;添加密钥到SSH代理;复制公钥到GitHub;测试连接。配置完成后,开发者可通过SSH地址克隆仓库,实现push/pull全程免密操作。该方案显著提升Git使用效率,同时保障安全性,是开发者必备技能。
2026-02-28 18:13:52
907
原创 lora微调qwen2.5-VL-Instruct模型
这篇文章介绍了使用LoRA方法微调Qwen2.5-VL-Instruct模型的过程。主要内容包括:1)环境配置,使用AutoDL服务器并安装必要的Python包;2)数据处理,将COCO 2014 Caption数据集转换为特定格式的CSV和JSON文件;3)模型训练,通过修改的train.py脚本进行微调,处理图像和文本输入。文章展示了数据处理的关键步骤截图,并提供了SwanLab监控工具的相关链接。整个过程涉及图像路径提取、对话格式转换和LoRA参数配置等技术细节。
2025-06-28 00:17:32
1124
原创 论文精读之Label-Augmented Dataset Distillation (LADD)标签增强数据集蒸馏
尝试精读一下基于标签增强数据集蒸馏的方法的论文
2024-10-09 20:47:20
1248
原创 Datawhale AI夏令营--从零入门多模态大模型数据合成Task1
主要还是跟着datawhale的文档走一遍,这一次学习的话还是有很多东西要学习的,要尽可能的避免不必要的资源浪费,因为每一次运行到一半但是发现运行没有成功很有可能导致大量的资源浪费
2024-08-14 16:03:50
682
原创 Unable to find resource t64.exe in package pip._vendor.distlib报错问题解决
更新python的pip版本的时候遇到的问题
2023-08-18 12:23:45
1357
空空如也
蓝桥杯真题之门牌制作
2022-03-10
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅
1