- 博客(99)
- 收藏
- 关注
原创 具身智能:原理、算法与系统 第12章 因果推理与物理理解
当存在隐混杂因素时,FCI(Fast Causal Inference)算法通过引入双向边(↔ )表示可能的隐变量影响,输出PAG(Partial Ancestral Graph)。这种能力对于机器人决策至关重要,因为机器人动作本质上是对环境的干预,理解动作与结果之间的因果机制是实现安全、可解释行为的基础。在机器人感知中,视觉特征与任务成功之间的相关性可能由未观察到的环境因素(如光照条件)引起,单纯基于相关性的策略在环境变化时必然失效。具身智能系统需要发展类似的物理直觉,以支持高效的对象操作与场景交互。
2026-02-22 14:20:33
70
原创 具身智能:原理、算法与系统 第11章 世界模型学习
从早期的前向模型到现代的潜空间动力学模型,从数据驱动的黑盒方法到物理信息混合架构,世界模型的表达能力与计算效率持续提升。Ha 与 Schmidhuber 的开创性工作展示了在想象空间中学习的可能性,PlaNet、Dreamer 与 TD-MPC 等算法将这一理念推向实用化,而物理世界模型与因果推理的结合则开启了更具解释性与泛化能力的新方向。结果模型 O 预测不同动作的长期回报。图中左侧显示了实际观察到的变量状态,右侧显示了在干预某个变量(如强制设置 X3=0 )后的反事实状态,以及相应的概率分布变化。
2026-02-22 10:54:02
103
原创 具身智能:原理、算法与系统 第10章 感知中的不确定性
本章系统阐述了偶然不确定性与认知不确定性的数学定义与物理来源,介绍了贝叶斯深度学习框架下的变分推断、MC Dropout、深度集成与神经过程等方法,并探讨了不确定性估计在安全决策、主动学习、失败预测与多传感器融合中的应用。偶然不确定性源于数据生成过程中的固有随机性,反映了观测噪声与任务本身的不可消除的模糊性。神经过程(Neural Processes, NPs)将高斯过程(Gaussian Processes, GPs)的函数分布建模能力与神经网络的计算可扩展性相结合,为不确定性估计提供了新的范式。
2026-02-22 08:38:36
80
原创 具身智能:原理、算法与系统 系列文章
具身智能:原理、算法与系统》是一部系统阐述具身智能理论与技术前沿的30章深度专栏。从认知科学的具身性转向出发,贯通神经科学、机器人学与人工智能的交叉脉络,构建"感知-认知-行为"三位一体的理论框架。内容涵盖视觉-触觉-听觉多模态感知、世界模型与因果推理、神经符号AI、运动控制与操作技能、人形机器人系统架构等核心技术,并深入探讨持续学习、安全对齐、集体智能等前沿议题。
2026-02-21 23:55:01
707
原创 具身智能:原理、算法与系统 第9章 主动感知与注意力
通过将最可能物体的模型投影到场景中,系统评估各视角下物体特征的可见性,选择能够最大化特征观测机会的视角。实验表明,该方法在82.5%的情况下成功找到导致物体识别的视角,并能在85%的试验中处理视觉遮挡。通过将点云投影到图像平面并计算跨模态注意力,系统能够利用图像的高分辨率纹理信息增强点云的语义理解,同时利用点云的精确深度信息补偿图像在远距离处的信息损失。预测误差方法面临"嘈杂电视"问题的挑战:在随机环境中,某些状态可能本质上是不可预测的(如电视雪花屏),导致智能体陷入无意义的探索。
2026-02-21 23:45:47
648
原创 具身智能:原理、算法与系统 第8章 听觉与其他感知模态
端到端架构进一步消除了人工设计中间表示的需求,注意力机制与变换器架构通过自注意力计算建立全局时间依赖,实现了从声学特征到字符或子词单元的直接映射。混响环境中的鲁棒定位要求网络学习对房间脉冲响应的不变性,多任务学习联合优化定位与去混响目标进一步提升了复杂声学场景的性能。听觉、本体感觉与新兴化学物理感知的整合不仅扩展了环境理解的广度,更通过跨模态关联深化了物理世界的认知深度。融合架构的设计需在计算效率、鲁棒性与表达能力之间寻求平衡,而端到端学习与神经符号方法的结合有望实现感知与推理的更深层次统一。
2026-02-21 23:43:00
70
原创 具身智能:原理、算法与系统 第7章 触觉与力觉感知
挑战在于触觉与视觉的空间对齐(触觉传感器坐标系到相机坐标系的变换)与时间同步(不同采样率的对齐)。BioTac的创新在于集成多种感知模态:电极阵列测量局部压力分布(空间分辨率约5mm),压力传感器检测整体接触力,温度传感器监测热传导特性,麦克风采集振动信号(模拟帕西尼氏小体)。这些技术推动电子皮肤向高分辨率(<1mm)、多模态(压力、温度、湿度、化学)与自供能(摩擦电、热电)方向发展。对比学习框架构建正样本对(同一接触位置的不同增强视图)与负样本对(不同位置或物体),拉近正样本在嵌入空间的距离。
2026-02-21 23:32:16
116
原创 具身智能:原理、算法与系统 第6章 视觉感知与场景理解
其训练数据SA-1B包含1100万张图像与10亿个掩码,由数据引擎迭代生成:辅助手动标注阶段、半自动阶段(模型生成部分掩码)、全自动阶段(模型生成完整数据集)。YOLOv4整合Bag of Freebies(数据增强、正则化)与Bag of Specials(注意力机制、特征融合),在COCO上达到实时检测的最优精度-速度权衡。位置编码基于点坐标的三维位置嵌入。提示编码器将输入提示映射为与图像特征对齐的嵌入,掩码解码器通过双向Transformer层迭代更新图像嵌入与提示嵌入,最终预测掩码与置信度分数。
2026-02-21 23:20:44
78
原创 具身智能:原理、算法与系统 第5章 双过程理论与认知架构
这种交互具有不对称性:系统2的激活是稀缺的、 effortful 的,而系统1的运作是默认的、 automatic 的。这种认知成本解释了系统2的 "laziness":默认情况下,系统2接受系统1的 suggestions,仅当检测到 cognitive conflict 或 error signal 时才投入 effortful processing。该理论将认知系统划分为两种 distinct modes of processing:系统1(System 1)与系统2(System 2)。
2026-02-21 22:06:22
134
原创 具身智能:原理、算法与系统 第4章 归纳偏置与学习效率
具身智能系统面临独特的归纳偏置设计挑战,其偏置谱系可从三个维度展开:形态偏置(Morphological Bias)、感知运动偏置(Sensorimotor Bias)与认知架构偏置(Cognitive Bias)。NFL定理的深层含义在于:学习算法的成功必须依赖于问题结构的特定假设,这些假设即构成归纳偏置(Inductive Bias)。归纳偏置定义为学习算法在学习过程中优先选择特定假设集的倾向,其数学表征为在假设空间 H 上的先验分布或结构约束。归纳偏置的强度构成学习效率与泛化能力的核心权衡。
2026-02-21 21:38:48
64
原创 具身智能:原理、算法与系统 第3章 具身智能的感知-认知-行为框架
具身智能的PCB框架源于对生物智能系统的观察:动物通过感官接收环境信息(感知),基于内部模型进行预测和决策(认知),并通过身体执行动作改变环境(行为),而这一改变又通过感知反馈形成闭环。这一框架在两篇核心文献中得到了深入阐述:提出了系统的数学形式化和工程实现,则从认知科学角度强调了归纳偏置和双过程理论的重要性。
2026-02-21 21:07:12
122
原创 具身智能:原理、算法与系统 第1章 具身智能的本质与范畴
从学术定义的角度,具身智能可被界定为"与物理环境进行有目的的能量与信息交换"的智能形式。这一定义揭示了具身智能的两个本质维度:信息处理维度与能量交互维度。与传统人工智能系统仅在信息空间操作不同,具身智能系统必须同时处理信息流与能量流,在物理约束下实现感知、认知与行动的统一。具身智能体具有三个核心构成要素:物理身体(Physical Body)、感知系统(Sensory System)与效应器(Effectors)。这三者共同构成了感知与行动的基础,使智能体能够通过物理交互而非纯粹符号操作来理解世界。
2026-02-21 20:32:42
217
原创 JEPA 深度实战:从理论到工业部署
这份教程涵盖了 JEPA 从理论到实践的完整流程,包含 2000+ 行可直接运行的代码。建议按照章节顺序学习,先掌握基础 I-JEPA,再扩展到视频、多模态等复杂场景。需要我针对任何特定章节进一步展开,或者提供特定领域的完整实现吗?目标:最大化互信息 I(Sx;Sy) ,同时保持 H(Sy) 防止崩溃。Sy=Enctarget(y) :目标表征(EMA 更新)Sx=Enc(x) :上下文表征。JEPA 最小化条件熵,学习。
2026-02-20 21:02:14
411
原创 Cosmos Reason 2 指南:从入门到高级应用
"""Cosmos Reason 2 自定义微调针对特定机器人任务微调 Cosmos Reason 2,提升领域性能。支持 LoRA 高效微调与全参数微调。"""@dataclass"""微调配置"""# 模型# LoRA 配置lora_target_modules: List[str] = None # 自动检测# 训练# 数据# 优化"""机器人任务数据集"""# 加载数据# 图像预处理])# 加载图像# 构建文本</s>"""
2026-02-20 20:19:24
118
原创 大型感知-认知-行为(PCB)模型:核心原理与技术
机器人系统的架构设计经历了从模块化分离到端到端统一的演进。传统三层架构将感知、决策与控制划分为独立模块,每个模块由特定算法实现,通过预定义接口传递信息。感知层负责从传感器提取环境特征,决策层基于特征进行符号推理与任务规划,控制层将高层指令转化为低层电机命令。这种设计源于经典人工智能的符号主义范式,强调知识的显式表示与逻辑推理。然而,这种分离架构存在根本性局限。信息在层级间传递时产生语义鸿沟:感知层输出的特征向量缺乏语义明确性,决策层难以直接理解;
2026-02-20 18:16:16
452
原创 雷达信号处理基础课后习题
雷达经常用作测量空间中某物体距离的手段。利用图1.3,从毫米波段挑出两个适用于雷达工作的频率和两个不适用于雷达的频率,并解释原因。对于矩形脉冲,为获得这样的瑞利带宽(傅里叶变换后峰值至第一零点的宽度),脉冲的长度应是多少?用D,和λ表示,某孔径天线均匀照射所形成的方向图的峰值至零点的波束宽度(称为瑞利波束宽度)。波束宽度与波长成正比,与孔径尺寸成反比——这就是雷达使用高频(短波长)和大天线获得高角度分辨率的原理。当雷达到目标的距离分别为100km、100英里和100英尺时,分别计算雷达回波的双程传播时延。
2026-02-19 21:26:54
398
原创 【雷达原理 学习笔记】至P69
雷达能够测角基于两个基本原理:电磁波直线传播雷达天线具有方向性1. 振幅法测向2. 相位法测向振幅法测向:通过测量回波信号的振幅来确定目标方向相位法测向:通过测量回波信号的相位来确定目标方向本章后续内容安排:7.2节和7.3节先讲解振幅法,再讲解相位法。相位法测角:重点介绍了多基线技术解决无模糊测角范围与测角精度之间的矛盾,详细推导了相位解模糊的算法流程,包括模糊数的计算、真实相位差的重构以及高精度角度的计算。振幅法测角:介绍了最大信号法的基本原理、影响精度的因素(波束宽度与信噪比)及其优缺点;
2026-02-19 15:37:37
1016
原创 【雷达原理学习笔记】64.P64目标距离测量(三)时间鉴别器的工作原理与数学模型 65.P65目标距离测量(四)
信号定义与关系因果时序分析选通放大与信号合成波形(4)经过前选通放大器,波形(5)经过后选通放大器选通放大器的功能类似于逻辑"与"运算(时域相与)前选通放大器和后选通放大器均为两输入一输出:前选通:输入为波形(4)和波形(3),输出为波形(6)后选通:输入为波形(5)和波形(3),输出为波形(7)波形(3)的来源:回波信号经回波处理电路整形得到。具体流程为:波形(2)为接收到的回波信号(呈包络形态)回波中心时刻 t 定义为回波最大值位置(相对于起始时刻)
2026-02-19 12:20:29
738
原创 内容待补充。内容待补充
1.2节 雷达的基本功能:对于矩形孔径,如果激励函数在两个孔径维可分离,方向图P可以因式分解成两个独立的一维方向图的乘积(Stutzman和 Thiele,1998)
2026-02-19 10:05:44
50
原创 【雷达原理 学习笔记 卫青老师】60.P60雷达作用距离(十七) 63.P63目标距离测量(二)
检测跟踪脉冲与目标回波之间的时差,输出误差信号。
2026-02-18 21:47:15
525
原创 【雷达原理 学习笔记 卫青老师】61.P61雷达作用距离(十八)mp4
在上一节我们提到,当目标的真实距离超过雷达的最大无模糊距离时,会产生“距离模糊”。为了解决这个跨周期带来的未知整数 $m$ 的问题,雷达系统最常用、也是最重要的方法之一叫做重频参差法(Staggered PRF)。
2026-02-18 20:32:28
46
原创 【雷达原理 学习笔记 卫青老师】59.P59 雷达作用距离(十六) 60.P60雷达作用距离(十七)
回顾雷达原理这门课程的整体编排,可以发现它是严格按照雷达系统的物理组成来分章设立的。第一章是绪论,第二章介绍发射机,第三章讲解接收机,第四章探讨显示器,而第五章则详细推导了雷达最大作用距离的各种方程形式。第五章的内容其实确立了一个核心前提条件:只有当目标到雷达的实际距离,处于系统计算出的最大作用距离之内时,目标才有可能被雷达有效探测到。在满足了第五章所讲述的“最大作用距离”这一探测前提之后,从第六章开始,课程将重点讲解雷达在探测到目标后,如何对目标的各项参数进行进一步的测量。
2026-02-18 19:45:43
632
原创 【雷达原理 学习笔记 卫青老师】57.P57 雷达作用距离(十四)
以上即为 5.7 小节的全部内容。本节主要探讨了有别于常规情况的几种特殊雷达方程。回顾本章内容,我们依次讲解了:二次雷达方程双基地雷达方程用能量表示的雷达方程干扰环境下的雷达方程(细分为有源干扰和无源干扰)贯穿这些推导过程的核心逻辑是:雷达能否检测到目标,本质上取决于接收系统处理后的“信噪比”或“信杂比”是否达到门限要求。整个第五章的内容都是紧密围绕不同环境条件以及各种系统参数变化对雷达方程的实际影响展开的。
2026-02-18 17:34:02
1032
原创 现代机器学习研究进展 第一部分 数学与概率工具箱 第三章 度量与分布距离
熵正则化的目标等价于在代价和 KL 约束之间权衡(见 Fenchel–Legendre 模)。可理解为在所有耦合中寻找既低成本又高熵(更“扩散”)的耦合。正则化的优势在于数值稳定、易于并行化、可微。
2026-02-18 17:03:46
869
原创 【雷达原理 学习笔记 卫青老师】54. P54 雷达作用距离(十一)55. P55 雷达作用距离(十二)
5.6小节"传播过程中各种因素的影响"重点讲解了上述两种情况:大气衰减的影响和直视距离的影响。5.7小节"雷达方程的几种形式"将留至下节课讲解。目前所讲的雷达方程均为基本雷达方程,且为单基地、开四次方的形式。下节课将介绍雷达的其他工作形式,即与基本雷达方程有所区别的其他形式雷达方程。本节课讲解第五章第七小节"雷达方程的几种形式"。在5.7小节以前,雷达方程主要基于一种形式,即开四次方的形式。在此基础上,讲解了各种原因造成的雷达方程变化,包括脉冲积累、目标起伏以及大气环境等各种影响,均是基于该雷达方程。
2026-02-18 16:26:48
736
原创 Intel Hala Point —— 全球最大神经形态系统的架构
模拟神经科学(Brain Emulation)与高效人工智能在模拟神经科学维度,神经形态系统追求生物神经回路的精确复现,关注神经元形态学、离子通道动力学与网络拓扑的保真度。此类系统通常采用亚阈值模拟电路或混合信号设计,旨在理解大脑的计算原理。而在高效人工智能维度,神经形态计算侧重于借鉴生物机制解决工程问题,其核心指标为能效比(TOPS/W)与延迟,对生物保真度要求较低,允许使用简化的神经元模型与数字实现。
2026-02-17 17:35:31
140
原创 Google Titans 深度解析
测试时训练指在模型推理(测试)阶段,部分参数仍通过梯度下降进行在线更新的训练范式。与传统训练-推理分离的范式不同,TTT使模型具备持续学习能力:其中优化器可以是SGD、Adam或自定义的动量方法。实际部署中,超长文档(如书籍、法律合同)采用分层处理策略。第一层将文档分割为固定长度的块(通常4096 token),每个块独立通过记忆模块生成块级摘要。第二层将块摘要序列作为输入,通过同一记忆模块生成全局文档表示。这种分层处理既保持了局部语义细节,又捕获了全局结构关系,且计算复杂度可控。
2026-02-17 13:44:42
457
原创 RWKV全解析
RWKV-Music利用RWKV的线性复杂度和高效状态机制,成功建模了音乐中的长程结构关系。对于14B以上模型,采用张量并行(Tensor Parallelism)将每层计算分布到多GPU,配合DeepSpeed的ZeRO-Inference技术,可实现单节点8卡A100对14B模型的实时服务,吞吐量达数千 tokens/秒。以GPT-4级别的上下文窗口(128K tokens)为例,朴素的注意力实现需要存储 1280002 规模的注意力矩阵,即便以半精度浮点数计算,单层的激活内存需求已超过32GB。
2026-02-17 13:13:06
75
原创 影子学习(Shadow Learning)
机器学习模型的部署带来了新的隐私风险维度。传统数据安全关注存储与传输过程中的原始数据保护,而模型泄露攻击揭示了训练数据隐私可以通过模型行为本身被推断。成员推断攻击(Membership Inference Attack, MIA)利用模型对训练样本与未见过样本在预测置信度上的系统性差异,判定特定数据记录是否被用于模型训练。这种攻击不直接获取原始数据,而是通过分析模型的输出模式反向推导敏感信息,对医疗记录、金融数据等隐私敏感领域构成实质性威胁。成员推断攻击的本质是二分类问题。
2026-02-17 11:32:41
111
原创 LeVERB框架——基于潜在视觉-语言指令的人形全身控制 解读
视觉-语言-动作(Vision-Language-Action, VLA)模型在静态操作任务中展现了强大的零样本泛化能力,然而现有系统普遍依赖手工设计的动作词汇表,如末端执行器位姿或根节点速度。考虑部分可观察马尔可夫决策过程(POMDP),其状态空间 S 包含人形机器人的关节配置与速度,观察空间 O 包含机载传感器数据与外部相机图像,动作空间 A 为关节力矩指令。该词汇表通过概率生成模型从大规模合成运动数据中学习得到,将离散的语义概念编码为连续的潜在变量,使底层策略能够执行相应的动态行为。
2026-02-17 10:50:21
579
原创 【WholeBodyVLA:面向全身移动操作的统一潜在视觉-语言-动作模型】(二) 第三章:实验验证与前沿拓展(应用层)
与GR00T N1.5相比,本方法在需要精细力控制的任务(装箱、装载)中表现更优,成功率分别高出12.4%和8.9%,但在纯语言指令跟随的泛化性上略逊一筹。将人形机器人数据与单臂操作数据混合训练单一LAM,在装箱任务中成功率下降至68.4%,且出现频繁的异常行为,如单臂操作数据导致的无效下肢动作。实验结果揭示了机器人学习中的数据缩放定律。首先,当前架构采用开环动作生成与闭环视觉反馈相结合的策略,但在长序列中,早期步骤的微小误差会通过动力学耦合传递并放大,而视觉反馈的频率(10Hz)不足以完全补偿这种漂移。
2026-02-17 10:36:09
597
原创 【WholeBodyVLA:面向全身移动操作的统一潜在视觉-语言-动作模型】(一)
全身控制的状态空间由本体感知与视觉观测融合构成。本体感知状态包含关节角度、角速度、力矩以及IMU测量的基座姿态与加速度。对于X2平台,这涉及27维关节空间加上6维基座位姿,共计33维本体状态。视觉观测通过头部相机获取,经DINOv2编码为固定维度的视觉特征向量。状态融合的关键在于时空对齐与不确定性建模。本体感知以1kHz高频更新,提供精确但局部的状态信息;视觉观测通常以30Hz采集,提供全局但延迟较大的场景理解。
2026-02-17 10:31:50
77
原创 TTT-Parkour 第二章:关键技术组件深度解析
参数高效微调(PEFT)旨在通过更新极少参数实现领域适应,降低计算与存储开销。适配器模块(Adapter)在基础网络的层间插入小型瓶颈网络,仅训练这些插入模块而保持原权重冻结。残差学习(Residual Learning)则通过学习的残差向量修正预训练输出。最后一层微调(Last Layer Fine-tuning)仅更新策略网络的最终输出层,假设高层表示具有足够迁移性。Adapter模块的结构通常为两层MLP组成的瓶颈:先将特征降维至低维空间(如64维),经非线性激活后再升维回原维度,并采用残差连接。
2026-02-17 10:01:36
679
原创 TTT-Parkour 第三章:实验验证与系统部署
实验结果表明,预训练策略在楔形物、桩柱、箱子、梯形、窄梁上的平均成功率分别为35%、12%、8%、25%、5%,平均23.4%。TTT-Parkour策略达到88%、78%、72%、85%、62%,平均77.0%,显著超越预训练策略(提升53.6个百分点),接近从零训练策略(差距12个百分点),但计算成本仅为后者的0.5%。值得注意的是,在真实重建网格上训练的策略迁移至真实硬件时,零样本成功率达60%,而手工网格训练策略仅为35%,验证了高保真重建对缩小sim-to-real鸿沟的关键作用。
2026-02-17 10:01:21
666
原创 TTT-Parkour 第一章:理论基础与核心范式
本框架采用两阶段端到端学习范式,将知识获取与快速适应解耦。第一阶段为大规模预训练,策略网络在多样化的程序化生成地形上进行深度强化学习,习得通用的视觉-运动协调先验。该阶段利用高并行度仿真环境积累数十亿级别的环境交互样本,训练一个具有强泛化能力的基策略。第二阶段为测试时训练(Test-Time Training, TTT),当机器人遭遇未知地形时,利用实时重建的高保真几何网格进行快速策略微调。该阶段通过迁移学习机制,在保持预训练知识的同时,针对特定几何特征进行策略优化。
2026-02-16 20:42:51
217
原创 ZEST:零样本具身技能迁移算法 第三章:实验验证与部署实践
映射函数采用可学习的神经网络,以人体关节角为输入,输出机器人关节角,训练数据来自配对的运动捕捉与机器人执行序列。随后,将人体姿态重定向至G1的关节空间。对于涉及地面接触的舞蹈动作,如地板动作,引入接触检测机制,当手部或脚部与地面的距离小于阈值时,触发接触力控制模式。特别地,针对液压系统的响应延迟,在动作输出环节引入20-50ms的随机延迟,增强策略对控制滞后的鲁棒性。实际部署时,策略运行在板载Jetson Orin上,推理延迟为12ms,配合500Hz的PD控制循环,实现了流畅的动作执行。
2026-02-16 16:34:44
209
原创 HUSKY——物理感知全身控制人形滑板系统 第三章:实验验证与深度分析
HUSKY-G1系统在该测试中表现出优异的轨迹保真度:RMSE为0.08米(5.3%相对误差),最大偏离0.15米发生在大小圆切换的曲率不连续点,终点重复精度(3个周期后回到起点的偏差)为0.12米。Bushings 作为聚氨酯弹性元件,其力-位移关系呈现显著的非线性与迟滞特性:小变形区(<5度)表现为线性弹性(刚度约15 N·m/rad),大变形区因材料软化刚度下降至8 N·m/rad,且加载与卸载曲线不重合形成滞环。正弦跟踪(幅值0.5 m/s,频率0.5 Hz)的相位滞后为0.15秒,幅值衰减3%。
2026-02-16 16:11:24
150
原创 ZEST:零样本具身技能迁移算法 第二章:算法架构与训练机制
这种设计显著降低了奖励工程的复杂度,同时增强了策略的泛化能力,因为策略不再过度拟合特定的奖励权重组合。不同于直接输出关节力矩或位置,策略网络输出归一化的动作意图,该意图通过可学习的增益矩阵映射为实际的关节指令。标准化后的动作空间被严格约束在负一到正一的区间内,通过双曲正切激活函数实现,确保策略输出的平滑性与有界性。整个系统的关键创新在于将物理引擎的精确性与学习算法的灵活性深度耦合,使得训练出的策略能够直接迁移到真实硬件而无需额外微调。这种按需干预避免了过度辅助导致的策略依赖,同时确保了训练初期的样本质量。
2026-02-16 16:09:49
42
原创 ZEST:零样本具身技能迁移算法 第一章:理论基础与问题背景
零样本仿真到现实迁移指的是在纯仿真环境中训练的策略,无需任何真实环境的数据收集或参数微调,直接部署于物理硬件并维持稳定性能。这一范式的核心在于通过领域随机化、系统辨识与鲁棒强化学习等技术,在训练阶段构建足够宽的动力学分布,使得真实系统的动力学落在策略的泛化范围内。近期的Humanoid-Gym框架与Denoising World Model Learning研究表明,通过大规模并行仿真训练与精心设计的随机化策略,人形机器人可以实现复杂的野外地形行走而无需任何真实环境微调。
2026-02-16 15:44:30
93
一个高性能的 LNN-CfC 模型
2026-01-30
基于物理信息的 Deep-ESN 用于频率捷变雷达微弱目标检测
2026-01-24
图神经网络示例代码-第一至6章
2025-11-19
AdaI-PINNs:高效求解界面问题的自适应物理信息神经网络框架
2025-11-18
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅