- 博客(18)
- 收藏
- 关注
原创 Autoware.universe 安装与环境搭建以及Demo运行
安装内容:Autoware + ROS2 + CUDA本地电脑环境:Ubuntu22.04+8核+8G运行内存+150G系统交换区间。
2024-10-10 11:33:01
3582
13
原创 下班1小时Day10 | Normalization 学习
BatchNorm 依赖 mini-batch 统计,适合大 batch CNN;LayerNorm 在单个 token 的 hidden 维度上统计,因此更适合 Transformer 和变长序列;RMSNorm 进一步去掉均值中心化,只控制向量尺度,因轻量稳定而广泛用于现代 LLM;理解各种 Norm 的关键,不是背公式,而是抓住两个问题:统计谁?前者决定均值、方差或 RMS 从哪些维度计算,后者影响残差路径、梯度传播和训练稳定性。选型时应结合数据形状、模型结构、batch 大小和任务目标综合判断。
2026-07-07 22:38:48
213
原创 下班1小时Day9 | 位置编码 学习
这组图从绝对位置编码讲起,进一步梳理相对位置、RoPE、ALiBi,以及图像和视频中的 2D/3D 时空位置编码。核心差异在于:有的方法把位置直接加到输入表示中,有的方法把距离信息融入 attention score,还有的方法通过旋转 Q/K 隐式表达相对距离。Transformer 本身擅长建模 token 之间的关系,但如果没有位置信息,它很难区分“我爱你”和“你爱我”。位置编码的作用,就是把“元素在哪里”转化为模型可计算的向量或注意力偏置。
2026-07-06 00:15:26
212
1
原创 下班1小时Day8 | VIT 学习
ViT 的关键思想,是把图像从“二维网格”转化为 Transformer 可以处理的“Token 序列”。一张图像会先被切成固定大小的 Patch,每个 Patch 展开后经过线性投影,得到一个视觉 Token;再加入位置编码,保留空间顺序信息。最终,经过多层交互后的 CLS Token 通常作为整张图像的表征,送入分类头完成预测。但需要注意:Patch 本身不是 Token,经过 Patch Embedding 后的向量才是 Transformer 真正读取的输入。
2026-07-06 00:11:06
211
1
原创 下班1小时Day7 | Attention 学习
Transformer 的注意力机制,本质是在为每个 Token 生成“上下文化表示”:先把输入投影成 Query、Key、Value,再用 Query 与 Key 计算相关性,通过 softmax 得到权重,最后按权重汇聚 Value。理解这条主线,就能把 Transformer 中最核心的结构串起来:不是简单记忆词序,而是学习 Token 之间可计算、可组合的关系。Multi-Head Attention 让模型从多个子空间并行观察不同依赖;
2026-07-05 01:56:54
187
1
原创 下班1小时Day5 | Flow-Matching 学习
以线性路径为例,中间点可写为 x_t=(1-t)x_0+t x_1,目标速度为 u_t=x_1-x_0;模型通过最小化预测速度与目标速度之间的 MSE,学习一个可积分的生成速度场。采样时,只需从噪声出发,沿学习到的 ODE 速度场积分,就能逐步流向数据分布。核心在于三件事:路径怎么定义、速度怎么监督、样本如何沿速度场生成。它不再把生成过程拆成大量离散去噪步骤,而是在连续时间上构造从噪声分布到数据分布的路径,并训练神经网络预测每个中间样本在当前时刻应该朝哪个方向移动。
2026-07-05 01:55:12
155
1
原创 下班1小时Day6 | Stable Diffusion学习
Stable Diffusion 的核心并不是“直接在高清像素上作画”,而是把图像压缩到 latent space,在更低维的表示中进行扩散去噪,再通过 VAE Decoder 还原成图像。文本 Prompt 经 Text Encoder 转为条件向量,U-Net 在 Cross-Attention 的调制下预测当前 latent 中的噪声,Sampler 按时间步不断更新,最终得到干净 latent。但它并非万能:细节、文字、真实性和偏见问题仍需人工判断与安全约束。
2026-07-01 23:05:56
180
1
原创 下班1小时Day3 | DDPM学习(附开源代码)
决定每晚花 1-2 小时,拆解具身智能核心技术,用最少量代码、零基础友好的方式实现,帮自己也帮大家筑牢底层地基,以不变应万变。最近 VLA、WAM、AGI 这些词每天听 N 遍,新词汇还没搞懂就成了 “旧热点”,越追越焦虑 😮💨。Day1 打卡✅ 今天啃的是「DDPM」的核心逻辑与极简实现。学习中用到的所有代码,都同步在这个开源仓库,新手也能直接跑通👇。内容有疏漏或理解偏差,欢迎大佬指正,也欢迎评论区一起交流学习!沉下心想了想:与其跟风追热点,不如沉下心打牢基础。⚠️ 踩坑点 & 避坑指南。
2026-05-23 00:42:09
44
1
原创 下班一小时系列 Day2--VQ-VAE
学习/整理过程中用到的代码,我都会放到下面这个仓库,尽量以最简单形式,最少量代码,零基础友好的形式来实现。欢迎关注:https://github.com/liu-ry/EmbodiedZero/tree/main/vae。冷静思考后,觉得还是需要每天花点时间学习、回顾、梳理这个赛道的内容,打好"具身地基",以不变应万变。最近VLA、WAM、AGI等词汇每天都要听无数次,各种新词汇也在不断涌现,新内容没学会就变成旧内容了,焦虑常伴左右。内容有啥问题,欢迎指正,也欢迎评论区讨论。
2026-05-22 00:15:43
26
1
原创 下班一小时系列 Day1--VAE
代码整理在Github中:https://github.com/liu-ry/EmbodiedZero/tree/main
2026-05-21 18:40:25
31
原创 VQ-VAE向量量化自编码器详解(附可运行代码)
码本是一个固定大小的向量集合,记为E = {e_1, e_2, …, e_K},其中K为码本大小(仓库默认K=64),每个e_i是一个与z_e维度相同的向量。码本是模型训练过程中逐步优化的参数,最终会学习到输入数据的特征分布,每个码本向量对应一类数据特征。三重损失相互配合:重构损失保证拟合精度,码本损失优化码本质量,承诺损失约束编码器输出,三者结合确保模型既能精准重构,又能学习到稳定的离散隐空间分布,为生成新数据提供基础。
2026-05-18 23:57:04
369
2
原创 VAE变分自编码器详解(附EmbodiedZero开源仓库实战)
VAE本质是一种基于概率模型的生成模型,核心目标是学习输入数据的隐变量分布,通过编码-解码流程实现数据的重构与生成。与传统自编码器相比,VAE引入了概率分布假设,解决了传统自编码器无法生成新数据、隐变量无明确物理含义的问题,为后续扩散模型、具身智能相关算法(如扩散策略)奠定基础。EmbodiedZero仓库中的VAE实现遵循「最小可运行、原理透明」原则,仅依赖PyTorch+torchvision,无多余框架封装,新手可快速上手跑通代码,非常适合用来夯实理论与工程基础。
2026-05-18 23:55:58
372
1
原创 LeRobot 框架架构与开发指南
LeRobot框架是一个分层机器人控制与学习系统,包含四层架构:脚本层提供训练、评估等入口;配置管理层处理策略和训练参数;核心模块层包含策略模型(Policies)、机器人控制(Robots)、数据集管理(Datasets)等关键组件;工具层提供控制、训练等实用功能。框架支持多种机器人平台(so_follower、koch_follower等)和策略模型(ACT、Diffusion等),并集成了数据采集、处理和环境仿真功能。开发指南包含新策略接入说明和关键文件参考,为机器人学习与控制提供完整解决方案。
2026-03-26 09:50:11
430
原创 Error response from daemon: Get “https://registry-1.docker.io/v2/“ 问题解决
docker 镜像拉取、docker 代理配置
2025-07-20 16:06:10
951
原创 Git 上传大文件数据
这里写自定义目录标题Git 上传大文件第一步 初始化将github上面建好的仓克隆到本地利用LFS进行大文件的上传通过秘钥成功上传Git 上传大文件搞了很久,最后终于上传成功,这里记录一下整个过程。借鉴了 “https://blog.csdn.net/wifi74262580/article/details/85060187” 中的方法,有部分不太一样。第一步 初始化初始化名字和邮箱:接着初始化git:将github上面建好的仓克隆到本地这一步好像是非必须,但是在我的电脑上如果不进行这一
2021-05-28 16:02:09
805
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅