- 博客(64)
- 资源 (14)
- 收藏
- 关注
原创 EgoScale: 基于多样化第一人称视角人类数据的灵巧操作规模化
EgoScale提出了一种通过大规模人类数据学习灵巧机器人操作的系统方法,证明了人类行为数据可以作为复杂机器人控制任务的主要训练信号。这项工作解决了机器人学中的一个基本挑战:如何将人类日常展示的丰富操作技能高效地转移到具有高度自由度的机器人系统上。该研究将人到机器人的转移确立为一种规模化现象,表明增加人类训练数据的量会导致机器人性能的可预测改进。
2026-04-02 18:44:21
595
原创 claude code 泄密源码深度解析
如果你还在用"复制代码 → 粘贴到 ChatGPT → 再粘贴回来"的方式工作,那你可能已经落后了一个时代。Anthropic 推出的(GitHub:)走的是一条截然不同的路:它不是一个插件,也不是一个网页对话框,而是一个真正的 AI 编程代理(Agent),直接在你的终端里运行,读懂你的整个代码库,自主执行复杂任务。笔者拿到了这份源码,仔细阅读了核心模块,发现里面有大量值得借鉴的工程设计思路。本文将带你从源码视角,深入了解它的架构、功能与亮点。① React 用于终端 UI。
2026-04-01 10:07:30
661
原创 上海交大 RoboClaw VS EmbodiedAgentsSys 两个框架对比分析
它解决的是机器人真正需要的核心问题:感知-规划-执行闭环、VLA 模型集成、能力边界感知、失败驱动学习。这些是具身智能从实验室走向实际部署必须解决的工程问题。——因为具身智能的核心挑战在于让机器人真正理解和操作物理世界,而不是让人更方便地下指令。但它需要补充 RoboClaw 级别的 LLM 集成和交互能力,才能形成完整的产品形态。,它解决的是"如何让人和机器人协作"的问题:自然语言操控、零代码接入、远程多平台控制。这代表了未来人机协作的交互方向,但目前的具身能力(感知、规划、多硬件)还太薄弱。
2026-03-27 22:32:13
499
原创 kimi的17岁高中生论文从零实现 Attention Residuals:用 50 条中英句对对比三种 Transformer 残差架构
结论细节✅ 收敛更快Full AttnRes 比 Standard 快约 16% 达到 loss=1.0✅ 最终 loss 更低Full AttnRes 最终 loss 0.050 vs Standard 0.054✅ 翻译准确率更高Full 88% vs Standard 72%(50条精确匹配)✅ 参数效率极高参数增量仅 +0.13%,性能提升来自信息路由而非参数✅ Block 版本工程友好内存从 O(Ld) 降到 O(Nd),大规模训练开销 <4%核心洞见。
2026-03-19 11:32:01
709
原创 开源!π0.6-MEM 机器人长时记忆架构完整实现——基于 Physical Intelligence 最新论文的工程落地
参考论文:,Physical Intelligence,2026年3月。
2026-03-19 09:51:31
2123
原创 开源 | EmbodiedAgentsSys:第一个从感知到执行的具身智能Agent全栈框架
欢迎 Star ⭐ / Fork / 提 Issue,一起把这个框架做好。
2026-03-18 23:31:19
583
原创 Helix 02技术报告:人形机器人的全身自主操控突破
本报告对Figure AI最新发布的Helix 02系统进行技术分析。该系统通过统一的全身体感网络,首次实现了人形机器人在完整房间尺度下、长达数分钟的端到端自主操作任务,标志着人形机器人从分离的动作控制向全身协调自主的重大转变。Helix 02是Figure公司迄今为止能力最强的人形机器人模型,通过单一的神经控制系统,直接从像素输入控制整个机器人身体,实现了跨越整个房间的灵巧、长时程自主操作。自主长时程移动操作:系统能够执行长达四分钟的端到端自主任务,如在整个厨房中卸载并重新装载洗碗机。
2026-01-30 13:38:27
1714
原创 一文看透小龙虾openclaw 技术实现
项目名称: ClawdbotGitHub 仓库开源协议: MIT项目规模: 15.4k 星标,1.9k 分支核心语言运行时要求包管理器: pnpm- Grammy 框架类型定义- body-parser 类型定义- Express 类型定义- markdown-it 类型定义- Node.js 类型定义- proper-lockfile 类型定义- qrcode-terminal 类型定义@types/ws- WebSocket 类型定义中心化 Gateway。
2026-01-27 15:55:41
1280
原创 基于Agent框架的通用人形机器人任务操作系统
*核心结论**: 该方案在技术上是**可行的**,采用**分层Agent+VLA架构**,相比端到端方案(如Cosmos-Reason1)具有更好的可解释性、安全性和工程可落地性。需要分阶段实施,优先解决感知、规划和安全等关键技术挑战。该方案在技术上是**可行的**,采用**分层Agent+VLA架构**,相比端到端方案(如Cosmos-Reason1)具有更好的可解释性、安全性和工程可落地性。| **可解释性** | ⭐⭐⭐⭐⭐ 分层设计,每层可独立解释 | ⭐⭐ 端到端黑盒,难以解释 |
2026-01-23 13:33:39
712
原创 AI编程能力的边界
启动与集成:快速理解、运行和集成开源代码库。日常任务:编写脚本(Shell/Python)、处理配置文件、生成样板代码。调试助手:解释编译错误、日志信息,提供常见的修复建议。文档与解释:快速生成代码注释、解释复杂代码段的功能。有限逻辑:实现有明确模式、算法已知(如排序、基础数据处理)的功能。然而,在涉及深度领域知识、复杂数学建模和创造性算法设计的问题上,AI目前显得力不从心。
2026-01-23 09:56:07
2664
原创 我的2025开挂实录!用AI编程,我干成了这些以前想都不敢想的事!
用cursor去SDK的demo代码,然后用ROS2进行21个电机的驱动封装,使用python写一个脚本发出挥手动作的电机角度。4、花了一周的时间弄懂了如何用unity获取VR手柄的数据,并且打包安卓程序安装到VR上,在PC端接收到VR手柄的位置和旋转。前一张图是cursor给我的2025年使用的总结,第二张图是我用deepseek解读使用22.2亿tokens的解读。5、复现了很多新的具身智能模型,以前需要一周才能复现的工作,现在只需要1天的时间。6、用AI写强化学习的教程,教程的入门要求是高中水平。
2025-12-25 20:06:18
239
原创 目标导向的强化学习与HER算法详解
强化学习(Reinforcement Learning, RL)🐕智能体(Agent)= 小狗🎯环境(Environment)= 你家的客厅🎮动作(Action)= 小狗的行为(坐下、握手、趴下)🏆奖励(Reward)= 你给小狗的零食(做对了+1分,做错了-1分)📍状态(State)= 小狗当前的位置和情况智能体通过与环境交互,尝试不同的动作,根据获得的奖励来学习"什么情况下应该做什么动作"。就像你学骑自行车:一开始不知道如何平衡(随机尝试)摔倒了(负奖励)保持平衡了(正奖励)
2025-12-12 13:56:51
1046
原创 ACT模型框架与训练流程分析
VAE编码器(VAE Encoder): 使用Transformer Encoder,将动作序列编码到潜在空间VAE解码器(VAE Decoder): 使用Transformer Decoder,从潜在空间解码出动作序列KL散度(Kullback-Leibler Divergence),也称为相对熵(Relative Entropy),是衡量两个概率分布之间差异的度量。KL散度的性质 / Properties of KL Divergence:非负性 / Non-negativity。
2025-12-01 17:00:01
845
1
原创 扩散模型简介:The Annotated Diffusion Model
andby OpenAI,by Google Brain. 中文:在这篇博客里,我们将深入了解(DDPM,也叫扩散模型、得分基生成模型或[自编码器]),因为研究人员已经凭借它们在条件/无条件的图像、音频和视频生成中取得了惊人的成果。撰文时的代表案例包括 OpenAI 的 [GLIDE] 和 [DALL·E 2]、海德堡大学的 [Latent Diffusion],以及 Google Brain 的 [ImageGen]。
2025-12-01 10:38:03
850
原创 【论文阅读】世界模型发展脉络整理---Understanding World or Predicting Future? A Comprehensive Survey of World Models
世界模型(World Models)理解世界机制:构建内部表示以理解环境的运作规律预测未来状态:预测环境的动态变化以指导决策世界模型是智能体(Agent)对环境的内部表示或模拟,用于:预测环境的动态和结果理解环境的结构和规律支持决策和规划观察模型- 从状态生成观察奖励模型- 预测奖励终止模型- 预测episode是否结束年份里程碑贡献1989Dyna架构结合模型学习和规划1990世界模型概念提出AI应具备世界认知2018World Models论文VAE-RNN范式,梦境训练2019。
2025-11-20 20:37:55
3014
1
原创 一文看懂PPO入门教程:从场景到代码实现,高中水平即可
在强化学习的数学模型中,有几个关键函数需要明确定义。理解这些函数的输入和输出,对于理解整个算法至关重要。函数之间的关系策略函数:π(a|s) → 动作概率分布↓动作函数:a ~ π(·|s) → 实际动作↓环境交互:执行动作a,获得奖励r和下一状态s'↓价值函数:V(s) 和 Q(s,a) → 评估状态和动作的价值↓优势函数:A(s,a) = Q(s,a) - V(s) → 评估动作的优势↓策略更新:使用优势函数更新策略函数关键公式状态价值与动作价值的关系优势函数的定义。
2025-11-20 15:04:50
1007
原创 小试牛刀:Flow Matching + PPO 结合架构
传统PPO的局限无法表达多模态动作分布(如抓取任务的多种可行路径)探索能力受限,依赖熵正则化Flow Matching的优势可以学习复杂的多峰分布基于连续归一化流,表达能力强推理速度快(5-10步ODE求解)关键挑战PPO需要计算log π(a|s)用于策略梯度Flow Matching是隐式生成模型,没有显式概率密度如何计算对数概率是最大技术障碍✅ 理论保证Flow-Noise基于Normalizing Flow理论对数概率计算有数学保证不依赖近似或启发式方法✅ 端到端训练整个系统可微分。
2025-11-20 10:59:55
1214
原创 PPO入门教程:从数学推导到代码实现(高中数学基础就可以看懂)
状态(State):你当前的情况(车把角度、速度、平衡情况)动作(Action):你采取的行动(向左转、向右转、加速、减速)奖励(Reward):你得到的反馈(保持平衡+1分,摔倒-10分)策略(Policy):你学习到的"经验"(在什么情况下应该做什么动作)强化学习就是让计算机(智能体)通过不断尝试,学习到最优的策略,从而在环境中获得最大的累积奖励。重要性采样(Importance Sampling):用旧策略的数据来估计新策略的期望值问题:我们想计算新策略的期望值,但只有旧策略的数据解决方案。
2025-11-20 10:28:31
935
原创 π*0.6论文创新点分析:对比传统VLA算法
1. **部署策略收集数据** → 2. **数据聚合与奖励标注** → 3. **微调价值函数** → 4. **计算Advantage值** → 5. **策略改进(Advantage Conditioning)** → 6. **性能评估与迭代决策**| **优势机制** | Flow-Noise | 标准RL | Advantage-conditioning | ✅ 更简单 || **策略更新** | 无 | **价值函数微调 + Advantage Conditioning** |
2025-11-19 14:25:08
987
原创 【论文阅读】清华大学最新具身智能综述:从大语言模型到世界模型
该论文提出了一种联合多模态大语言模型(MLLM)和世界模型(WM)驱动的架构,旨在推动具身智能(Embodied AI)迈向通用人工智能(Artificial General Intelligence)。该方法将MLLM的语义推理能力与WM的物理感知预测能力相结合,克服了实时适应和物理基础方面的局限性,从而使智能体在动态环境中变得更强大和适应性更强。
2025-10-22 11:18:02
1390
原创 【论文阅读】DiffusionDrive:截断扩散模型用于端到端自动驾驶
DiffusionDrive引入了一种用于端到端自动驾驶的截断扩散模型,通过解决计算开销和模式崩溃问题,实现了实时多模态轨迹生成。该系统在NAVSIM数据集上创造了新的性能记录,以45 FPS达到88.1 PDMS,同时生成多样化且合理的驾驶动作。
2025-10-21 16:19:45
892
原创 【论文阅读】具身竞技场:面向具身智能的全面、统一、演进式评估平台
论文题目: Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI论文地址:https://arxiv.org/pdf/2509.15273来自包括天津大学和华为诺亚方舟实验室在内的全球联盟研究人员开发了Embodied Arena,这是一个评估具身人工智能(Embodied AI)代理的综合平台,其特点是具有系统的能力分类和自动化的、由LLM驱动的数据生成流水线。
2025-10-10 09:46:52
1201
原创 【论文阅读】具身人工智能:从大型语言模型到世界模型
本文全面综述了具身人工智能领域的现状,特别强调了整合多模态大语言模型(MLLM)和世界模型(WM)的协同潜力。它提出了一种联合MLLM-WM驱动的架构,以克服各自的局限性,并推进具有物理基础和语义智能的智能体。
2025-09-28 10:36:07
1553
原创 【论文阅读】纯视觉语言动作(VLA)模型:全面综述
调查论文《纯视觉语言动作(VLA)模型:综合综述》对新兴的VLA模型领域中三百多项近期研究进行了结构化分类和系统回顾。VLA模型整合了视觉感知、语言理解和机器人控制。该论文整合了基础资源,分析了其在各种机器人实体中的应用,并指出了实现通用机器人技术的关键挑战和未来研究方向。
2025-09-25 22:20:21
1397
原创 【论文阅读】AutoDrive-R^2: 激励自动驾驶VLA模型的推理与自我反思能力
自动驾驶系统已从传统的模块化流水线发展到集成式端到端方法,其中视觉-语言-动作(VLA)模型代表了最新的进展。然而,当前自动驾驶中的 VLA 模型面临关键挑战:它们经常生成物理上不可行的轨迹,并且在复杂的驾驶场景中难以进行充分的推理。AutoDrive-R² 通过一个全面的框架解决了这些局限性,该框架增强了自动驾驶系统的推理能力和物理可行性。图 1:AutoDrive-R² 框架概述,展示了完整的框架以及不同模型之间的比较结果,证明了在轨迹预测任务中的卓越性能。
2025-09-22 20:45:15
1165
原创 【论文阅读】OpenDriveVLA:基于大型视觉语言动作模型的端到端自动驾驶
传统上,自动驾驶技术依赖于模块化系统,这些系统将感知、预测和规划分离成不同的组件。虽然这种方法有效,但可能会导致模块之间的误差传播,并且难以应对需要综合推理的复杂场景。大型语言模型(LLM)和视觉语言模型(VLM)的最新进展已经显示出理解复杂场景和做出高级决策的潜力,但将它们直接应用于自动驾驶提出了重大挑战。图 1:OpenDriveVLA 模型的多阶段训练过程的概述,展示了如何通过分层特征对齐、驾驶指令微调、智能体-环境-自我交互和轨迹规划来集成视觉、语言和动作能力。
2025-09-22 20:40:49
1688
1
原创 【论文阅读】RynnVLA-001:利用人类示范改进机器人操作
由达摩院和湖畔实验室开发的 RynnVLA-001 引入了一种视觉-语言-动作 (VLA) 模型,通过对大规模人类第一视角视频演示进行预训练,改进了机器人操控。它在实际操作任务中取得了 90.6% 的平均成功率,超越了 GR00T N1.5 (55.6%) 和 Pi0 (70.4%) 等最先进的基线模型。
2025-09-22 15:33:38
1240
原创 【论文阅读】GR-1:释放大规模视频生成式预训练用于视觉机器人操控
ByteDance研究院推出了GR-1,一个GPT风格的Transformer,它利用大规模以自我为中心的视频生成预训练,在多任务视觉机器人操纵中实现了增强的泛化能力和数据效率。该模型在基准测试和真实世界任务中均优于现有基线,在未见场景和语言泛化以及有限机器人数据方面表现出鲁棒性能。
2025-09-22 14:27:57
1153
原创 【论文阅读】GR-2:用于机器人操作的生成式视频-语言-动作模型
开发能够理解自然语言指令并执行各种操作任务的机器人系统,仍然是人工智能和机器人领域的一项重大挑战。GR-2 (通用机器人代理 2) 通过将视频预训练与机器人动作生成相结合,以统一的模型架构,代表了该领域的重大进步。图 1:GR-2 的双重训练过程,展示了对各种人类活动的视频-语言预训练(左)和对机器人特定视频-语言-动作数据的微调(右)。GR-2 由字节跳动研究人员开发,建立在基础模型原则之上,这些原则已在自然语言处理和计算机视觉等其他领域证明是成功的。
2025-09-22 14:14:40
1158
原创 【论文阅读】理解世界还是预测未来?—— 世界模型全面综述
该调查将世界模型定义为旨在“理解世界动态并确定性(或在一定保证下)计算下一状态”的系统。这个总体目标被分解为两个相互关联但又独立的功能,构成了本文的分析框架。第一个功能是外部世界的隐式表示,侧重于模型如何通过潜在变量和学习到的表示来内化环境机制。这包括传统的基于模型的强化学习方法,其中准确的转换动态支持策略优化,以及大型语言模型作为世界理解强大骨干的出现。这些模型展示了跨越空间、时间、物理和社会动态的卓越“世界知识”。第二个功能是物理世界的未来预测,强调生成动态未来状态的能力。
2025-09-22 14:01:19
731
原创 【论文阅读】OpenVLA:一个开源的视觉-语言-动作模型
OpenVLA 代表着在使先进机器人AI更广泛地为研究社区所用方面迈出了重要一步。该论文介绍了一个70亿参数的视觉-语言-动作(VLA)模型,该模型能够使用自然语言指令和视觉观察来控制多个机器人实体。与现有最先进的闭源模型(如RT-2-X)不同,OpenVLA是完全开源的,提供了对模型权重、训练代码和微调过程的完整访问。图1:OpenVLA架构,展示了DINOv2和SigLIP视觉编码器融合后馈入Llama 2语言模型骨干,并输出离散化的机器人动作。
2025-09-22 13:52:47
1245
原创 【论文阅读】π0:用于通用机器人控制的视觉-语言-动作流模型
开发能够执行各种任务的机器人一直是机器人领域长期存在的挑战。传统方法通常需要为单个任务训练专门的策略,从而导致泛化能力有限,并且每项新能力都需要大量数据。π0(发音为“pi-zero”)模型通过创建一个通用机器人控制系统来解决这些限制,该系统能够跨不同的机器人平台执行各种操作任务。图 1:π0 模型架构,展示了预训练的视觉-语言模型(VLM)骨干网络如何处理视觉输入和语言指令,并通过动作专家模块生成机器人动作。
2025-09-22 13:50:01
1439
原创 【论文阅读】GR00T N1:面向通用人形机器人的开放基础模型
通用人形机器人的研究长期以来一直是机器人学研究的核心目标。传统的做法侧重于针对特定任务的专用系统,而基础模型方面的最新进展为创建多功能机器人智能提供了新途径。GR00T N1 代表着这一方向上的重要一步,它引入了一个专门为通用人形机器人设计的开放式基础模型。图1:GR00T N1 采用的分层数据金字塔策略,将网络数据和人类视频作为基础,合成数据作为中间层,以及真实世界机器人轨迹作为顶层,以解决机器人学中的“数据孤岛”问题。
2025-09-22 13:48:29
1153
原创 【论文阅读】4D-VLA:时空视觉-语言-动作预训练与跨场景校准
4D-VLA将4D时空信息整合到视觉-语言-动作(VLA)预训练中,解决了机器人操作中的坐标系混乱和状态混乱等问题。该模型在LIBERO基准测试中实现了12.1%的更高成功率,并在真实世界任务中展现了强大的泛化能力,提高了控制和精度。
2025-09-22 13:43:54
950
原创 【论文阅读】Long-VLA:释放视觉语言动作模型在机器人操作中的长时程能力
Long-VLA引入了第一个专为长程机器人操作设计的端到端视觉-语言-动作(VLA)模型,采用相位感知输入遮罩策略来调整感知焦点。该模型显著提高了在模拟和真实世界环境中多步骤任务的成功率,优于现有最先进的方法。
2025-09-22 13:42:45
1275
原创 【论文阅读】Robix:机器人交互、推理与规划的统一模型
Robix 代表着在构建能够与人类在复杂、动态环境中自然交互的通用机器人方面迈出了重要一步。传统的机器人系统依赖于碎片化、模块化的方法,将推理、规划和交互分离成不同的组件,而 Robix 采取统一的方法,将所有这些能力集成到一个单一的视觉-语言模型中,作为分层机器人系统的认知层。该系统在分层架构中运行,其中 Robix 充当高级认知控制器,为低级执行系统生成原子命令,并为人机交互生成自然语言响应。这种设计实现了诸如主动对话、实时中断处理和上下文感知推理等复杂功能,这些功能远远超出了简单的任务执行。
2025-09-22 13:14:05
1098
原创 40岁从智驾转具身智能之路
我的工作经历比较复杂,本科毕业后工作2年再次读研的,本科和硕士都是机械专业,硕士毕业后干了5年CAM和机器人再转入到自动驾驶行业。在自动驾驶干了8年,发现自动驾驶已经到了一个瓶颈,再次转行做具身智能。我就谈谈自己的最近这次转型之路。
2025-09-19 21:50:13
587
原创 具身智能VR遥操开发记录
TeleVision主要是使用网络穿墙的方式,使用免费的次数有限制,而且我也不是专家,虽然获取到VR手柄的数据,但是每次都要在VR的网页上输入网址,最终放弃了,还被公司的防火墙监测到异常,给拦截了。最近自研的轮式双臂人形机器人需要有遥操设备,也看了很多家的遥操,一般是外骨骼的方式比较多,要么是有编码器与机器人关节进行映射,要么是发送末端位姿,基于时间和成本的考虑,决定自己用VR开发遥操。最终实现了可以接收到VR手柄的数据,包括手柄的位置、旋转和按键的状态。
2025-09-19 20:19:03
1144
2
原创 完整强化学习教程:基于4x4网格世界的智能体探索之旅(二)
之前我们的小智只能选择离散的动作:上、下、左、右、不动。但现实中的很多任务需要连续的动作。例子:问题:传统DQN无法处理连续动作空间,因为:最简单的方法:将连续动作空间离散化。例子:假设小智可以选择移动的精确角度优点:缺点:思路:用函数近似器来处理连续动作。方法1:最大化优化方法2:NAF (Normalized Advantage Functions)最成功的方法:结合策略梯度和价值函数!这就是我们下一章要学习的内容!让我们扩展网格世界,使小智可以选择连续的移动方向和速度:动作空间:A={(θ,v)∣θ∈
2025-06-13 13:33:29
853
Multi-View 3D Object Recognition in Point Clouds
2017-05-22
Fast and Robust Multi-View 3D Object Recognition in Point Clouds
2017-05-22
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅