- 博客(1155)
- 资源 (9)
- 收藏
- 关注
原创 具身智能操作知识梳理与拓展
NPY: NumPy原生格式,存储单个数组或字典TFDS: TensorFlow Datasets格式,用于TensorFlow生态系统RLDS: Robotics Language-conditioned Dataset,机器人任务数据集HDF5: 分层数据格式,支持大型复杂结构化数据。
2025-04-23 13:54:52
7038
1
转载 强化学习的几个主要方法(策略梯度、PPO、REINFORCE实现等)---下
策略梯度算法在理想情况下,在采样次数足够多的情况下效果是能很不错的,但是当采样不够时就会出现一些问题,例如GtG_tGt的取值是很不稳定的,下图可以形象说明:由于GtG_tGt的取值不稳定,所以(st,at)(s_t, a_t)(st,at)更新也不稳定。由于GGG的值有点太不稳定太玄学了,因此我们可以想办法去用一个神经网络去预测在sss状态下采取行动aaa时对应的GGG期望值,之后再训练中我们就直接用这个期望值去替代采样的值。为了完成这个目的,我们可以使用基于价值的方法深度Q网络,深度Q网络有两种
2025-01-22 15:23:34
5667
转载 强化学习的几个主要方法(策略梯度、PPO、REINFORCE实现等)---上
策略梯度算法在理想情况下,在采样次数足够多的情况下效果是能很不错的,但是当采样不够时就会出现一些问题,例如GtG_tGt的取值是很不稳定的,下图可以形象说明:由于GtG_tGt的取值不稳定,所以(st,at)(s_t, a_t)(st,at)更新也不稳定。由于GGG的值有点太不稳定太玄学了,因此我们可以想办法去用一个神经网络去预测在sss状态下采取行动aaa时对应的GGG期望值,之后再训练中我们就直接用这个期望值去替代采样的值。为了完成这个目的,我们可以使用基于价值的方法深度Q网络,深度Q网络有两种
2025-01-22 15:21:31
5723
转载 看完这篇文章,我终于搞懂了 CMake,真香!(高级篇补充)
不要硬编码路径用相对路径,让用户通过文件会安装到和。更灵活,无需管理员权限,跨平台也好用!如果有一些头文件没有实现(比如接口、纯抽象类),可以用INTERFACE接口库(INTERFACE)用于配置一些公共的链接和编译选项,小型项目可能用得少,大型项目常见。CMake 是个强大的工具,但要用得好,还是需要一些技巧和经验。包管理和安装配置:重点是让你的库好用、易装。
2025-01-10 18:25:58
8400
转载 聊聊端到端自动驾驶通用感知架构的前世今生
这张图演示的是相关方法的演进。这其中大部分都是基于BEV的方法,上图就是BEV-based相关方法的相关演进, 用某种方式将图像视角特征转到BEV特征空间,也就是一个高度方向拍扁的自车3D坐标系空间下,再用一个检测的Head实现目标检测。BEV这张图的尺寸通常比较大,比如一般常见的论文里面会用128×128 size,但在实际中,我们甚至会用两倍大小的BEV特征图。从图像特征空间向BEV层空间转换过程,是一个非常密集的计算过程。
2024-10-23 10:33:10
5588
转载 空间坐标(系)如何进行变换?
要描述某一物体在现实场景的位置,通常以三维空间坐标系下的坐标进行说明,当物体位置或自身进行变化时,可以用放射变换说明物体的变化情况。根据现实情况,坐标系和物体可以相互描述,即二维平面坐标(系)变换的情况包括一个二维平面坐标系描述一个物体(坐标)变换情况和一个物体(坐标)在两个二维平面坐标系间的变换情况。根据现实情况,坐标系和物体可以相互描述,即三维空间坐标(系)变换的情况包括一个三维空间坐标系描述一个物体(坐标)变换情况和一个物体(坐标)在两个三维空间坐标系间的变换情况。[3] 你不来我不老.
2024-09-04 10:45:26
2696
原创 Clion 使用
默认情况下,CLion编译使用的CMake是其内置的一个版本,而使用这个版本的CMake进行编译时会报出一些莫名其妙的错误,命令行中catkin_make明明可以正常编译,而这里就是会失败。回到一开始的"Threads & Variables"窗口,左上角有一些控制按钮,从左到右依次是:Rerun(Ctrl+F5),Stop(Ctrl+F2),Resume(F9),Pause(暂时用不上),Step Over(F8),Step Into(F9),Step Out(Shift+F8)。
2024-08-31 16:21:38
11640
转载 IMU preintegration on manifold 学习笔记(一)
Posted on 2023-02-18 Edited on 2024-07-11 In vslam Views:ω∧=[ω_1ω_2ω_3]∧=[0−ω_3ω_2ω_30−ω_1−ω_2ω_10]=WW∨=[0−ω_3ω_2ω_30−ω_1−ω_2ω_10]∨=[ω_1ω_2ω_3]=ω\mathbf{\omega}^{\wedge}=\begin{bmatrix}\omega\_1\\ \omega\_2\\ \omega\_3\end{bmatrix}^{\wedge}=\begin{bmatrix}
2024-07-12 12:10:41
3962
原创 CMakeList整理大全
之前我们也整理过。但是这里面整理的内容其实是不全的。所以我们需要进一步将CMake的使用整理好。以供后面的学习的工程师来检索查询。
2024-04-29 14:41:26
20207
原创 C++ CPU程序占用率高问题排查
我们在之前介绍了使用Valgrind、perf、AddressSanitzer等工具来完成内存泄漏的检测,当然内存泄漏以外还有cpu的占用率变高这类问题。作者在这里提供几个方法来对C++程序中CPU程序占用率高问题排查。
2023-12-29 13:14:36
9539
转载 Linux中.a、.so和.o文件以及-I,-L,LIBRARY_PATH,LD_LIBRARY_PATH等
(3) 修改/etc/ld.so.conf文件,把库所在的路径加到文件末尾(直接写在文件末尾,不要在路径前加include),并执行ldconfig刷新(ldconfig 命令的用途,主要是在默认搜寻目录(/lib和/usr/lib)以及动态库配置文件/etc/ld.so.conf内所列的目录下,搜索出可共享的动态链接库(格式如前介绍,lib*.so*),进而创建出动态装入程序(ld.so)所需的连接和缓存文件.缓存文件默认为/etc/ld.so.cache,此文件保存已排好序的动态链接库名字列表.)。
2023-08-16 17:14:24
4250
原创 SLAM本质剖析番外-李群李代数的微分和导数
这几个月,博主已经从SLAM算法的使用向着算法的数学推导进行了记录和分享,之前也分享了一文,从现象中解释了李群和李代数表达的含义。但是这还不够,所以这次作者作为SLAM本质剖析的番外,来介绍李群李代数的微分和导数。
2023-01-16 16:10:19
11771
2
转载 undefined symbol问题的查找、定位与解决方法
而这块可以看到fpdf_parse_encrypt是依赖于下边的fx_crypt文件的,再看静态库,fpdf_parse_encrypt被编译成fpdfapi.a,而fx_crypt被编译进pdrm.a静态库,所以应该是fpdfapi.a要依赖于pdrm.a静态库的。ldd命令,可以查看对应的可执行文件或库文件依赖哪些库,但可执行文件或库文件要求与操作系统的编译器类型相同,即电脑是X86的GCC编译器,那么无法通过ldd命令查看ARM交叉编译器编译出来的可执行文件或库文件。
2022-12-14 14:53:39
11623
4
原创 自动驾驶-激光雷达预处理/特征提取
激光雷达作为自动驾驶最常用的传感器,经常需要使用激光雷达来做建图、定位和感知等任务。而这时候使用降低点云规模的预处理方法,可以能够去除无关区域的点以及降低点云规模。并能够给后续的PCL点云分割带来有效的收益。
2022-08-24 21:12:44
5331
2
原创 C++之生成器(builder)模式
0. 简介生成器是一种创建型设计模式, 当构建一个复杂对象时,将构建过程与表示分离。使得同样的过程创建不同的对象。生成器与其他创建型模式不同, 生成器不要求产品拥有通用接口。 这使得用相同的创建过程生成不同的产品成为可能。生成器方法通常支持方法链 (例如 someBuilder->setValueA(1)->setValueB(2)->create() ),来组成复杂的对象。相比于工厂模式专门用于生产一系列相关对象而言,生成器重点关注如何分步生成复杂对象。1. 生成器UML介绍生
2022-03-07 10:38:52
10059
4
原创 C++命名规则&书写规范
常见命名法:匈牙利命名法:基本原则是:变量名=属性+类型+对象描述\color{blue}{变量名=属性+类型+对象描述}变量名=属性+类型+对象描述,其中每一对象的名称都要求有明确含义,可以取对象名字全称或名字的一部分。命名要基于容易记忆容易理解的原则。保证名字的连贯性是非常重要的。Camel命名法:即骆驼式命名法,原因是采用该命名法的名称看起来就像骆驼的驼峰一样高低起伏。Camel命名法有两种形式:混合使用大小写字母和单词之间加下划线\color{blue}{混合使用大小写字母和单词之间加下划线}混
2021-05-12 10:42:19
6405
2
原创 Qwen3.8-27B-FP8 部署实践:从原理到生产
UCloud旗下的Compshare算力共享平台提供高性价比的4090/5090 GPU算力资源,支持灵活计费与独立IP。本文详细记录了Qwen3.8-27B-FP8大模型在RTX4090单卡和5090双卡环境下的部署实践,重点解决显存不足、版本冲突等核心问题。该模型采用混合注意力架构和FP8量化技术,配合vLLM的PagedAttention内存管理,显著降低显存占用。实测双卡配置可解决32GB单卡显存不足问题,虽增加20-30%首token延迟,但吞吐量提升40-50%,适合生产环境部署。文档涵盖技术原
2026-08-18 10:33:44
367
转载 48小时扒光Kimi K3,这哥们是个狠人...
回头看这条技术路线,会发现每一次升级都在解决上一种方法留下的问题。GPT-2使用KV Cache保存前面的所有内容,记得很完整,但上下文越长,缓存就越大。线性注意力把所有历史压缩进固定大小的记忆,降低了长文本成本,却让不同信息容易互相干扰。DeltaNet让模型能够修改旧记忆,减少新旧信息之间的冲突。Gated DeltaNet加入遗忘能力,让模型可以主动清理已经过时的内容。KDA进一步细化遗忘机制,使不同类型的信息能够拥有不同的保存时间。
2026-08-09 10:26:35
44
原创 Bridge-WA:预测世界“在哪变、怎么变”,再让机器人出手
本文提出Bridge-WA方法,通过构建三类紧凑的world-action先验(未来令牌、变化图、运动流图),将未来场景演化的关键信息注入动作决策模型。相比传统视觉-语言-动作模型,该方法避免了生成完整未来视频的高计算成本,而是提取对控制最有用的结构化变化信息。实验表明,在分布外视觉扰动下,Bridge-WA在VLABench上达到52.8%的平均成功率,并在真机测试中显著优于基线。其核心创新在于训练时用大模型学习场景演化,部署时仅保留轻量化的先验预测模块,实现了高效且鲁棒的机器人操作。项目主页:https
2026-07-26 16:50:58
2018
原创 ASPIRE:让编程智能体在机器人身上“越debug越强“
摘要 ASPIRE是NVIDIA GEAR联合多所高校提出的机器人持续学习系统,解决了传统code-as-policy范式中调试信号粗粒度、经验难积累的问题。系统通过三个核心组件构建开放式学习循环:(1)暴露逐原语多模态轨迹的执行引擎,提供细粒度诊断信息;(2)技能库沉淀验证过的修复经验;(3)进化式搜索机制在程序空间探索优化。实验表明,在LIBERO-Pro和Robosuite任务上,ASPIRE相比基线最高提升77个百分点,且技能库越大零样本迁移能力越强。系统采用coordinator-actor架构,
2026-07-26 16:50:40
2016
原创 开放词汇重定位:当相机不再寻找像素,而是寻找“沙发、收音机和它们之间的关系”
摘要 OpenReLoc提出了一种基于开放词汇对象级表征的视觉重定位方法,通过将室内环境建模为语义物体的空间排列而非像素纹理集合,解决了传统低层特征在光照变化和弱纹理场景下失效的问题。该系统包含四个关键创新:1) 利用CLIP视觉与文本特征实现长尾物体匹配;2) 采用仅保存物体ID与二维框的轻量参考帧提供大场景粗定位;3) 通过双向二维最近像素损失对齐完整物体轮廓;4) 构建全局场景图建立物体间空间关系。实验表明,相比传统方法,OpenReLoc在保持厘米级精度的同时,将地图存储压缩至3.5MB(ScanN
2026-07-26 16:50:16
1897
原创 NavWAM:让机器人一边“想象未来“,一边“决定怎么走“
本文提出NavWAM模型,用于解决机器人目标导向视觉导航中的核心挑战——在部分可观测环境下实现高效决策。传统方法如NWM需外挂规划器进行动作搜索,计算开销大且实时性差。NavWAM创新性地将动作生成融入扩散模型内部,通过联合建模动作、未来状态、画面和目标进度价值,实现单次推理完成视觉预测与决策。该方法基于扩散-变换器架构,将导航任务转化为对"去噪画布"的联合优化,在保持预测能力的同时将推理速度提升至实时水平(20Hz以上),显著改善了动态环境下的控制连续性。实验表明,NavWAM在保持与NWM相当导航成功率
2026-07-26 16:49:40
1978
原创 CORE Planner 深度解读:基于上下文记忆的强化学习未知环境导航
本文提出CORE方法,针对未知环境导航中常见的死锁振荡问题(机器人反复做出矛盾决策导致原地打转)提出了创新解决方案。不同于传统方法仅依赖当前环境信息,CORE通过将历史轨迹编码为可见性图节点的访问计数,使决策网络能够感知过往路径选择。该方法采用标准Transformer架构,核心创新在于环境表示设计:使用稀疏可见性图替代密集栅格地图,节点级记忆机制替代固定长度历史缓冲区。实验表明,这种设计实现了从纯图像仿真环境到真实机器人的零样本迁移,无需微调或物理引擎支持。系统通过增量式图维护和并行化碰撞检测保证了实时性
2026-07-26 16:48:57
2047
原创 LaWAM 代码设计深度解读:从 Teacher-Student 蒸馏到隐空间世界模型的工程实现
文章摘要(147字): LaWAM系统采用两阶段训练架构:第一阶段预训练LAM模型,通过无监督学习从视频中提取离散潜动作编码,其编码器和解码器在第二阶段分别作为Teacher和世界模型复用;第二阶段将LAM与VLM、动作生成头组装,通过占位符注入机制实现多模态模型与动作空间的对接。核心创新在于"后验教先验"的蒸馏范式——Teacher路径(LAM编码器)基于真实帧间变化生成潜动作标签,Student路径(QFormer)则从单帧观测预测动作意图。推理时仅保留Student路径,实现高效决策。 关键点: 模块
2026-07-26 16:48:25
1933
原创 机器人如何“想象未来“:隐空间世界动作模型 LaWAM 深度解析
本文介绍了LaWAM模型,一种在视觉隐空间中进行未来预测的高效方法。针对动态物体操作中实时预测的挑战,LaWAM摒弃了传统的像素空间重建,转而预测紧凑的"隐空间视觉子目标",仅用230M参数的小模型实现了24倍推理提速,并在LIBERO任务上达到98.6%的成功率。 文章首先通过折毛巾和高速公路并线的例子,阐释了实时预测对机器人控制的重要性,指出当前像素级世界动作模型存在计算冗余、延迟高的问题。LaWAM的创新在于将未来预测整体迁移到DINOv3预训练的视觉隐空间,通过隐动作模型(LAM)学习动作意图,并复
2026-07-26 16:47:59
2000
原创 从“预测未来“到“选择未来“:WAV 如何把价值函数装进 VLA 的推理闭环
文章摘要 World-Value-Action (WAV) 提出了一种新型具身智能框架,解决了视觉语言动作模型(VLA)中长时序规划的关键问题。传统VLA模型在长时序任务中成功率仅50%左右,主要因其"短视"特性——只预测下一步动作而忽视长期后果。WAV创新性地将世界模型、价值评估和动作生成三个模块统一在潜在空间中,通过迭代采样优化动作轨迹。训练采用三阶段Flow Matching策略,先独立训练各模块再联合微调;推理时引入MPPI风格采样,在潜在空间而非动作空间搜索,显著提升可行轨迹的采样效率。实验表明该
2026-07-26 16:47:27
1961
原创 VisualClaw 深度解读:把流式视频多模态智能体的成本砍到 2%,是怎么做到的
VisualClaw系统突破流式视频智能体的"不可能三角",通过三时间尺度设计实现成本、延迟与适应性的平衡。该系统将处理分为微秒级边缘过滤、毫秒级云端推理和分钟级离线进化三个层次,边缘端采用dHash感知哈希与128维手工特征进行帧过滤,减少98%的上传数据;云端结合记忆库与技能库实现高效问答;离线进化器通过失败案例持续优化技能库。实验表明,该方法在显著降低API成本的同时,准确率提升3.85%-15.8%,为可穿戴设备等实时视频应用提供了可行的解决方案。
2026-07-26 16:47:01
2011
原创 AHA-WAM:异步时域自适应世界动作建模——让机器人用“慢脑袋+快手“控制物理世界
AHA-WAM提出了一种异步执行的世界动作模型,解决了视频生成速度与机器人控制频率不匹配的问题。传统方法将视频规划和动作执行同步进行,导致要么控制频率被拖慢,要么视频质量下降。AHA-WAM通过双DiT架构将两者解耦:Video-DiT负责低频长视野的视频规划,生成可复用的潜在上下文;Action-DiT则高频运行,通过交叉注意力机制查询规划上下文,实现快速闭环控制。配合OVCR路由、视野自适应偏移训练等机制,模型在保持物理预测能力的同时,将控制频率提升至56.95Hz,在RoboTwin任务上达到92.8
2026-07-26 16:46:46
2028
原创 GICI-LIB:把卫星、惯导、相机塞进同一张因子图里的开源高精度定位库
文章摘要 GICI-LIB是一个多传感器紧耦合定位框架,创新性地将GNSS、IMU和视觉传感器在因子图层面统一融合。相比传统方案(如RTKLIB仅处理GNSS、VINS仅处理视觉惯性),它通过共享参数块和残差块的设计,实现了十多种定位算法(SPP、RTK、PPP等)在同一架构下的协同工作。 核心优势体现在三方面: 工程架构上采用传感器层与因子图层的解耦设计,新增传感器只需扩展残差类型; 通过C++模板技术将GNSS残差抽象为统一接口,代码量比RTKLIB减少68%; 支持原始观测级紧耦合,保留多路径误差处理
2026-07-26 16:45:56
2001
原创 Rule-VLN:当 VLN 智能体被迫从「能不能去」切换到「可不可以去」
本文提出Rule-VLN,揭示了现有视觉语言导航(VLN)模型普遍忽视规则合规性的问题。作者构建了CityNav-Rules-73K数据集,将交通标志映射为可执行动作子空间,并设计语义剪枝图将规则合规性建模为图剪枝问题。核心创新SNRM模块作为零训练插件,在不修改主干策略网络的情况下,通过合规判别函数动态过滤违规路径,将违规率降低19.26个百分点。该工作首次将VLN从单纯几何可达性评估扩展到规则合规性维度,为实际部署提供了关键安全保障。
2026-07-26 16:45:33
2185
原创 SEA-Nav 深度解读:让四足机器人在密集障碍中“分钟级“学会安全敏捷穿行
本文提出了一种高效的四足机器人导航方法SEA-Nav,专为解决密集障碍环境下的训练效率和安全性问题。传统方法面临碰撞惩罚权重难以调节和长程任务样本效率低的挑战,而SEA-Nav通过三个创新组件实现突破:1)ACSI机制通过碰撞前关键状态回放提高样本效率;2)可微LSE-CBF安全投影层将物理安全嵌入网络最后一层;3)运动学动作正则确保输出在硬件安全范围内。实验表明,该方法仅需单张RTX 4090训练几十分钟,即可在真实环境中实现零样本部署。网络采用共享Backbone与双并联输出头设计,Critic网络绕过
2026-07-26 16:45:16
2204
原创 WAM-Nav 论文解读:非对称潜空间世界-动作模型如何统一视觉导航
本文提出WAM-Nav,一种新型无地图视觉导航方法,通过联合生成动作轨迹与短时域视觉预见来解决传统反应式策略的前瞻性不足问题。不同于端到端策略或模块化世界模型,WAM-Nav采用共享DiT架构,在潜空间同步生成24步动作和1步视觉预见,使近未来视觉约束直接参与动作决策。该方法创新性地将Flow Matching引入控制生成,并通过双查询目标对齐统一处理图像目标、点目标和无目标探索任务。实验表明,WAM-Nav在窄通道、动态遮挡等复杂场景中显著优于现有方法,同时保持0.26秒的低推理延迟。
2026-07-26 16:44:58
2208
原创 π*0.6 与 RECAP代码学习----让 VLA 从经验中学习
摘要 视觉-语言-动作模型(VLA)从行为克隆(BC)到强化学习的演进面临三大挑战:奖励稀疏、在线交互昂贵和数据混杂。本文提出π0.6模型与RECAP框架,通过知识隔离(KI)和离线强化学习解决这些问题。π0.6将模型容量扩展至Gemma3 4B主干和860M动作专家,并引入KI机制,通过分块注意力矩阵隔离动作专家梯度,防止污染视觉-语言表征。RECAP框架采用分类价值函数和优势条件策略,结合Classifier-Free Guidance实现离线强化学习,无需昂贵在线交互。实验在LIBERO-10等任务上
2026-07-26 16:44:38
2077
原创 Reasoning RL:从奖励信号到可训练推理能力
本文探讨了Reasoning RL(强化学习驱动的推理)如何通过将推理链的成功与否作为训练目标,从根本上改变了大模型的推理能力培养方式。与传统的提示工程方法(如Chain-of-Thought、Self-Consistency等)不同,Reasoning RL通过可验证的奖励信号直接优化推理过程本身,使模型学会动态分配计算资源到有效的推理路径上。文章分析了传统方法的局限性,详细阐述了Reasoning RL的四个核心训练环节(采样、奖励计算、策略更新和迭代收敛),并强调其关键优势在于让模型内化推理能力而非模
2026-07-26 16:44:14
2318
原创 从 Skills 到超级团队:AI 时代的能力资产体系
摘要: 本文探讨了如何将AI工具的使用经验转化为可复用的结构化能力资产,提出能力资产化的五个层级:知识、技能、流程、反馈和组织资产化。当前AI使用方式存在一次性对话局限、知识与应用场景脱节等问题,导致经验难以沉淀。文章重点介绍Skill作为能力最小单元的设计原则,包括触发机制、上下文优化、指令校准等,并展示了如何将视频等线性知识转化为可调用Skill。通过NotebookLM和Dynamic Workflows等工具组合,实现知识的场景化调用和流程编排,最终推动个人效率向团队协作能力的转化。核心观点是:只有
2026-07-26 16:43:26
2291
原创 从迪士尼主题公园到开源社区:Open Duck Mini v2 双足机器人的技术全貌
摘要: Open Duck Mini v2是一个开源双足机器人项目,旨在以低成本(<400美元)复现迪士尼BDX机器人的核心功能。项目基于强化学习,通过3D打印结构和廉价舵机(Feetech STS3215)实现14自由度双足行走。硬件设计缩小尺寸至42厘米,采用树莓派Zero 2W主控和BNO055 IMU传感器。训练方法结合PLACO运动规划生成参考轨迹,在MuJoCo仿真环境中训练策略网络,最终部署到实机。观测空间严格匹配实机传感器数据,确保仿真到现实的迁移可行性。该项目通过工程简化降低了技术门槛,为
2026-07-26 16:43:07
2304
转载 具身智能人形机器人产业链全景图
该文章以图文形式展示了机器人产业链的七大核心环节:1.整机厂商(含工业/服务机器人企业);2.具身数据企业;3.末端执行器供应商;4.执行器组件(电机、减速器等);5.环境与本体传感器(视觉/力觉/位置传感等);6.驱动与车载算力硬件;7.算法与软件层。每部分均配有产品示意图,系统呈现了从硬件组件到智能系统的机器人产业全链条技术图谱,突出了多领域协同的产业生态特征。(99字)
2026-07-14 09:15:07
70
原创 深度估计技术详解:从传感器缺陷到智能补全
本文提出了一种创新的掩码深度建模(MDM)范式,用于解决深度感知中的透明与反光物体难题。不同于传统方法将传感器缺陷视为噪声,MDM巧妙地将这些缺陷转化为学习信号。通过分析透明物体(信息缺失)与反光物体(信息过载)的本质差异,MDM采用分离式Patch嵌入和智能掩码策略,在ViT架构基础上实现了RGB与深度信息的跨模态推理。该框架通过自然掩码(传感器缺失区域)与随机掩码的结合,统一了单目深度估计和深度补全任务,为机器人等智能体在复杂场景中的3D感知提供了新思路。
2026-06-24 21:47:05
2839
原创 从模仿学习到对抗运动先验:AMP算法深度解析与实战指南
摘要: 人形机器人运动控制领域存在两种主流模仿学习技术路线:基于跟踪奖励函数的方法(如DeepMimic/H2O)通过逐帧姿态误差最小化实现高保真动作复现,但需持续参考轨迹输入;基于对抗模仿学习的方法(AMP)则通过判别器学习运动风格分布,实现更灵活的任务解耦。跟踪方法在动作精度和训练稳定性上占优,而AMP在风格泛化和动态环境适应上更具优势。最新研究如BeyondMimic通过扩散策略蒸馏将跟踪学到的技能复用至新任务,显示两条路线正走向融合。技术选择需权衡动作精度、数据量、任务类型等要素,未来可能形成"跟踪
2026-06-24 21:46:30
2858
3
原创 大模型格式全解析:从浮点数数组到部署落地的完整链路
原生格式是模型训练完成后最原始的输出,完全绑定训练框架。PyTorch 的.pt.bin、TensorFlow 的.ckpt/SavedModel 都属于这一类。它们的定位是服务于训练、微调和科研,而非直接部署。原生格式的核心特点可以用三个词概括:松散、依赖、未优化。"松散"指的是除了核心权重数组之外,还附带大量训练辅助信息;"依赖"指的是数组的解析必须依赖原始训练框架和模型结构代码;"未优化"指的是数组未做内存对齐、量化等处理,加载速度慢、内存占用大。
2026-06-24 21:45:58
2778
ROS 导航功能调优指南∗.pdf
2022-01-07
小觅摄像头Opencv处理
2019-07-06
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅