- 博客(820)
- 资源 (1)
- 问答 (1)
- 收藏
- 关注
原创 具身智能、端到端、自动驾驶、大模型......技术交流群汇总
深蓝学院搭建了16个领域的交流群(具身智能、端到端、自动驾驶、机器人、大模型......等等),小伙伴们可以在群内交流、分享问题、获取行业资讯。这样在各大企业工作的,可以相互内推,互通信息;在学校读研读博的,可以交流想法,携手合作。截至目前,我们的社群已经细分到了【16】个子方向的领域,并且还在不断地壮大规模!不限学校、不限专业,只要你是人工智能相关行业的人就能加入(社群内会有。的面试题以及论文资源,还有相关领域的小伙伴一同学习、交流!所以,如果你想要跟更多优秀的小伙伴扎堆学习成长,后台私信。
2025-11-17 10:28:42
343
原创 2024年自动驾驶规划控制面试及答案
A*吸取了Dijkstra 算法中的cost_so_far,为每个边长设置权值,不停的计算每个顶点到起始顶点的距离(G),以获得最短路线, 同时也汲取贪婪最佳优先搜索算法中不断向目标前进优势,并持续计算每个顶点到目标顶点的距离(Heuristic distance),以引导搜索队列不断想目标逼近,从而搜索更少的顶点,保持寻路的高效。DWA,TEB算法。通常情况下,在机器人高速运动的时候,想要得到非常连续、平滑、噪音低的运动控制,第3个约束条件是必不可少的,有的甚至还要求加速度的导数jerk都是连续的。
2024-07-22 18:43:12
1867
原创 浙大FLOAT:不倾斜机身、不倾转旋翼,2cm缝隙里稳稳拉抽屉,突加200g载荷不炸机
它证明了,通过巧妙的机械设计与深度的非线性控制相结合,无人机完全可以像一个克制的绅士,在不破坏环境的前提下,精准地完成物理操作。在机身保持水平的状态下,FLOAT 稳定拉出了 5.42 N 的横向力,这为其在狭窄空间内执行推拉任务提供了充足的动力储备。在抽屉推拉任务中,把手和前面板的间隙只有 2 cm,如果高度误差超过这个数值,挂钩就会直接撞在柜子上,任务直接宣告失败。给出了一个巧妙的解法——不靠倾斜机身,也不靠倾转旋翼,而是在旋翼下方的下洗气流中布置伺服驱动的控制面来“拨动”气流。
2026-07-15 17:15:00
6
原创 横扫10大AI顶会“最佳论文”的学术巨擘:他们是谁?
他包揽了3次ICRA最佳论文主奖。这10大顶会的Best Paper不仅是对过去一年最杰出研究的褒奖,更是通向通用人工智能(AGI)道路上的一座座里程碑。从CVPR、ICCV、ECCV到NeurIPS、ICML、ICLR,再到机器人领域的ICRA、IROS、RSS、CoRL,这10大顶会见证了从深度学习爆发到大模型涌现,再到具身智能落地的全过程。在人工智能与具身智能飞速发展的今天,顶级学术会议的“最佳论文(Best Paper Award)”不仅是学者个人荣誉的巅峰,更是整个领域技术演进的“风向标”。
2026-07-15 10:15:00
60
原创 宇树G1登上Nature!全球首例人形机器人完成活体手术
更实际的是,大多数手术室最初为手动手术设计,da Vinci的docking需要额外空间,不是所有医院都能部署。头部摄像头检测trocar上的ArUco标记,实时估计RCM位置,通过逆运动学求解器将医生给出的器械尖端目标位姿映射为机器人腕部关节运动。FLS分数差距确实大,但da Vinci Xi是数十年迭代的成熟商业产品,人形平台用的是研究阶段的G1,不在“同一条起跑线上”。另一个值得注意的数据:高级外科医生在人形平台上的FLS分数93.57,与da Vinci Xi的98.69。
2026-07-14 17:15:00
295
原创 VLA首次搞定真实家具组装!牛津大学突破1500步长时序双臂协同瓶颈
当进度超过阈值(τ=0.95)且通过简单高频滤波(连续两帧都超阈值,或隔几帧再次触发),系统自动切到下一子任务指令,重置进度、清空动作缓存,不需要外部状态估计器。,各子任务成功率在67%~87%之间,远高于完整组装的40%,进一步确认失败模式是子任务间误差累积,而非某个环节无法完成。刚完成组装的接触状态极不稳定,微小的执行误差会让下一子任务的起始分布变得很宽,进入没见过的状态空间、开始漂移。而机械臂撤退到远离家具的悬停位置后,无接触、无受力约束,小偏差不会放大,每个子任务的起始状态更窄、更一致。
2026-07-14 10:15:00
321
原创 NVIDIA最新“论证”!当前主流的端到端路线,在持续学习上是否存在根本性的缺陷?
▲不断扩展的技能库 | ASPIRE 维护着一个不断增长的技能库,该技能库将经过验证的修复方法提炼成模块化的、可转移的机器人知识,这些知识可以作为未来任务的上下文指导进行检索。真正值得期待的,是一个能让两者协同工作的系统:模型负责感知和动作,技能库负责经验和记忆,机器人在每一次成功和失败中都能积累下真正有用的东西,而不是让经验随着任务结束一起消散。但光是“用代码控制机器人”并不新鲜,ASPIRE 真正关键的一步,是把每次调试成功的经验提炼成一条可复用的技能,存进一个共享的技能库。
2026-07-13 17:12:38
319
原创 只用公开数据,强化学习后训练让VLA成功率提升13个点
Z-1没有提出新算法,GRPO是DeepSeek的老方法,π0.5是现成模型,RoboCasa是开源平台,它做的是把这些已有组件组合成能稳定跑通的RL后训练pipeline,每一环都给出可复现的工程方案。同组8条全成功时,标准GRPO用组内均值归一化,比均值慢的成功轨迹拿到负优势,等于惩罚"虽然慢但成功了"的轨迹,把策略推向激进加速。主流方案默认冻结视觉语言模块只更新动作专家。VLA的RL后训练是2025年下半年爆发的方向,πRL、ReinFlow、VLA-R1、SimpleVLA-RL都在做类似的事。
2026-07-13 10:15:00
625
原创 强化学习求解逆运动学,这五类方案值得重点关注!
传统双臂IK需要联立两组运动学方程求解耦合变量,方程维度叠加后求解复杂度指数上升,该类多智能体强化学习方案拆解耦合运动学约束,通过多智能体奖励博弈完成协同IK求解,适配桌面级协作机械臂实物调试。从运动学理论来看,该架构实现「数据驱动正模型+梯度驱动逆求解」闭环,完成无精准DH参数、非线性形变设备的逆运动学求解,适配软体连续体机器人、磨损非标工业机械臂作业场景。传统求解算法仅能输出局部范围内的关节角度方案,强化学习依托环境试错搜索,可以遍历空间内多组可行关节解,适配冗余七轴机械臂、双臂协同机器人的求解需求。
2026-07-12 10:15:00
342
原创 动态SLAM的“既要又要”难题,DL-SLAM用像素层+物体层双层概率解决了
问题是,一个站在路边不动的人,对SLAM来说就是一堆高质量的几何约束——他的轮廓、深度、纹理全可以用,非要把人家删了,纯属浪费。最终像素的动态概率不仅来自几何误差,还做了语义层面的聚合——同一个物体实例上的像素共享运动状态,取前四分位数和中位数的平均值作为该实例的整体概率,避免个别误判像素带偏整体判断。DL-SLAM的做法是:物体级删除完成后得到一个纯净的静态地图,用这个纯净地图渲染一张"它认为正确的概率图",然后把这张渲染图作为先验,用贝叶斯公式更新原来的像素级概率。
2026-07-11 17:15:00
327
原创 自动驾驶核心算法盘点|规划与控制篇
蓝色虚线为动态规划给出的粗略速度曲线,绿色虚线为二次规划在可行域内平滑后的最终速度曲线,图中可见"follow-yield(跟车让行)"与"overtake(超车)"两种决策对应的不同可行区域。预测输出(黄色点)会逐渐逼近参考轨迹(红色曲线),但控制器只执行当前时刻的第一个指令,随后在下一时刻重新滚动求解,以应对实际状态与预测的偏差。图中定义了车辆相对于目标路径的横向偏差 (车辆质心到参考路径的垂直距离)和航向偏差 (车辆朝向与参考路径切线方向的夹角),这两个量构成 LQR 控制器的核心状态输入。
2026-07-11 10:15:00
338
原创 牛津大学提出 PriorEye:给端到端自动驾驶外挂了一套“地理视觉记忆”(ECCV 2026)
持久记忆的作用就是一个"不知道该干嘛时就盯着我"的安全桩——不提供有用信息,但也不提供错误信息。人类司机开车依赖的远不止眼睛,还有记忆,我们知道每天经过的路上,第三个路口有急弯,知道学校门口常有人横穿,因此能提前收油、提前变道,根本无需等到眼睛确认。但在“记忆先验直接参与规划闭环”这一几乎无人问津的领域,牛津团队的这份答卷,无论从方法设计还是实验完整度来看,都非常扎实有力。现有端到端方案,无论回归式(LTF)、扩散式(GTRS-DP)还是评分式(DrivoR),输入都局限在几秒窗口内的实时观测。
2026-07-10 17:15:00
286
原创 2026做具身智能算法,掌握VLM、VLA就够了吗?
仅使用仿真数据训练的策略,就能实现零样本的Sim-to-Real迁移,平均成功率超过58%,并且仿真中的成功率与真实世界的成功率呈现出强相关性。它直接瞄准了双臂高自由度操作这一更难的问题。图7 | Dream-Tac统一触觉世界动作模型,(a)接触信号示例,(b)模型架构(联合建模未来视觉/触觉/动作),(c)与基线的性能对比,(d)六类接触丰富操作任务。它能够从极少量的源演示出发,通过将单/双臂接触丰富技能与全身移动操作规划交错,自动合成适应新物体位姿、无碰撞的稳定轨迹,实现约1000倍的数据放大。
2026-07-10 10:15:00
368
原创 ECCV 2026 | 清华&智源团队实测:VLA模型的“安全对齐”远未完成!
第一层是直白的伤人指令,第二层是违背常识的操作(比如空锅干烧),第三层是藏在话里的陷阱,看着无害实则危险,专门测大模型的安全对齐能力。说白了:现在所有机器人模型,只在实验室固定环境里能保证安全,放到家里、工厂这种杂乱的真实环境,碰撞风险会成倍涨,目前还没有能打全场的通用方案。训练集里全是安全轨迹,没有碰撞、失误的反面例子,机器人只能学“怎么做安全”,没法直观理解“什么事不能做”,极端风险预判能力有限。专门测危险指令的赛道里,老牌模型面对直白的伤人指令,80%能拒绝,但遇到藏在话里的陷阱,拒绝率只剩20%;
2026-07-09 17:15:00
301
原创 从卖硬件到做AI平台,大疆正在悄悄完成一次战略转身
这种将"专家级飞行员的技能"固化在算法中的策略,使得Skydio在工业巡检、国防安防等对飞行门槛要求极高的专业领域,形成了独特的竞争优势。更重要的变化发生在FlightHub 2的最新版本上:大疆引入了视觉语言模型(VLM)集成,打破了预设类别的限制,使得无人机在巡逻路线中能够识别常规类别之外的复杂场景和对象,无需为每个使用场景单独训练算法。研究人员探索的方向不再局限于"这是什么物体",而是延伸到"这些物体之间是什么关系"以及"这个场景意味着什么",从而在未知的、非结构化的环境中支撑更复杂的决策。
2026-07-09 10:15:00
209
原创 北大提出LaST-HD:让机器人跟人手学操作,世界模型来翻译!
单只手套重量不到100克,内置6枚紧凑型9轴IMU模块,在统一的手部坐标系下追踪21个手腕关键点(20个解剖学关键点+1个腕部关键点),采样率超过200Hz,端到端延迟低于10ms,关键点位置的均方根误差达到亚毫米级。,绕开视觉层面的硬对齐,转而构建一个共享的“物理推理隐空间”,让两者先在这个空间里达成共识,再派生具体动作,既保留人手的物理通用性,又兼容机器人的执行特性。仅用50条机器人数据+50条人手数据协训的Mix-HD版本,拿到了68%的平均成功率,与用满100条机器人数据的版本(73%)差距不大。
2026-07-08 17:15:00
345
原创 五大具身模型详解:VLM、VLA、VLN、VLX、世界模型
在模型推理阶段,网络会同步融合语言导航指令、实时视觉场景、三维空间结构三类信息,通过海量真实场景导航数据的迭代训练,拟合自然语言导航需求、环境空间状态与机器人最优移动路径之间的对应关系,输出适配当前场景的导航规划结果。在数字化技术的支撑下,物理世界的各类实体信息、空间信息、运动信息、时序变化信息,都可以通过量化、编码、张量化的方式转化为计算机可识别的数字矩阵与特征向量。,涵盖场景内物体类别识别、物体空间关联关系解析、场景整体属性判定、自然语言指令语义拆解、模糊口语指令的标准化转换、场景动态事件描述等内容。
2026-07-08 10:15:00
316
原创 香港科技大学(广州) | 不到一年连发4篇顶会,将离散VLA推至30Hz实时控制!
真实世界实验中,倒水任务从15%提升至80%,折毛巾从5%提升至75%,平均成功率从33.25%提升至77.50%。,重构为可通过Jacobi定点迭代求解的非线性方程组,摒弃逐次前向传播的低效逻辑,通过双向注意力替换原有因果注意力,解除token预测的时序依赖,实现所有动作token同步迭代更新、并行收敛。从PD-VLA的Jacobi并行到CEED-VLA的一致性蒸馏加速并行,从UD-VLA的联合扩散并行到Fast-dVLA的块间流水线并行,PD-VLA甚至出现了加速后性能反升的现象(72%→94%)。
2026-07-07 17:15:00
365
原创 没见过的赛道直接飞!苏黎世大学新框架,让RL无人机零样本泛化提升7.4倍
论文里做了个很直观的实验——给一个在Figure8赛道上训练好的策略,在它已有的轨迹上加一个不影响飞行路径的冗余门,结果策略穿完这个门后直接失稳坠毁。论文在附录中展示了一个更残酷的实验:依次在4条赛道上顺序训练同一个策略,每换一条新赛道,之前赛道的成功率直接归零,而且永不恢复。从单赛道专精到EaP的“能飞但慢”,再到这篇的“又快又泛化”,下一步可能就是跨分布泛化和更复杂的真实环境部署了。真正有价值的是SplitS赛道:EaP直接坠毁飞不了,新方法5.28秒飞完,和专精策略的4.70秒差距不大。
2026-07-07 10:15:00
338
原创 半年11篇!盘点浙江大学高飞团队2026上半年核心工作
系统通过LLM生成多样化场景描述与参考图像,再由Marble 1.1 Plus输出高保真3DGS场景,配合迭代式自动标注与EGO-Planner动力学可行轨迹生成,最终构建了包含500个场景和5万条轨迹的大规模数据集,覆盖六大场景类别,每个场景生成成本仅约2美元。具体来说,系统接收自然语言指令后,调用视频生成模型生成一段"未来导航视频",再通过基于采样的优化方法,利用视觉语言模型(VLM)对候选轨迹视频进行打分和筛选,最后通过逆动力学模型将视频计划解码为可执行的路径点。
2026-07-06 17:15:00
144
原创 UC Berkeley | 只用单目RGB视频,就能搞定机器人灵巧动作?
因此研究改进了跟踪逻辑,固定单帧提取的物体标准网格,仅用扩散模型迭代更新每帧6自由度位姿,同时引入2D点跟踪自适应调整引导强度αₚ,物体转动幅度越大,时序约束权重越高,抑制跳变。需要激光雷达、深度相机配套采集视频,重建精度高,但数据采集门槛极高,无法利用现成网络素材,仅适合实验室定点数据生产,规模化拓展能力基本为零,工程落地价值有限。,无需深度、动捕、专用传感设备,就能重建完整手物交互三维运动,并映射至多自由度灵巧机械臂,输出可直接真机运行的操控数据。
2026-07-05 10:15:00
566
原创 Science Robotics 上半年封面文章!盘点当前具身智能的标杆研究
从海底听音辨位的CUREE,到月背独立运行的SORA-Q,再到依靠海量数据掌握复杂操作的LBM,具身智能正在摆脱对人类实时指令的依赖,学会在复杂的物理约束中寻找最优解。无论是多语种唇形同步的面部机器人、液态金属仿生眼,还是传递触觉的外骨骼,都在试图打破机器与物理世界、机器与人类之间的隔阂,让交互变得更加多模态、更加自然。SORA-Q的成功,证明了即使是极其受限的微型硬件平台,也能通过巧妙的机械设计和高度自主的控制算法,在极端地外环境中完成复杂的具身智能任务。
2026-07-04 17:15:00
381
原创 让VLA暂时“看不见”,为什么反而能学得更好?上交×阿里团队给出全新解法
t-SNE 可视化也给出了类似信号。在 MetaWorld 上,No pretrain 为 69.73%,LA 为 83.00%,LA-VLA 为 86.75%,MixPT 达到 87.53%;在 LIBERO 上,No pretrain 为 92.85%,LA 为 95.30%,MixPT 为 95.75%,LA-VLA 达到 96.28%。在相同原子动作片段上,如果保留视觉输入做 VLA pretraining,MetaWorld 为 79.78%,LIBERO 为 94.40%;
2026-07-04 10:15:00
314
原创 每秒20次指尖反馈!伯克利×英伟达×李飞飞团队推出T-Rex触觉灵巧操作框架
仅用海量人类视频完成前期预训练搭建通用先,中期再投入100小时同步触觉真机数据专门训练触觉分支,无需采集带触觉的人类视频,大幅降低数据成本,同时保留大模型零样本能力。,依托异步混合Transformer专家架构,打通VLA模型与高频触觉闭环控制的隔阂,配套行业首个以动作基元为核心的大规模同步触觉机器人数据集。单任务少量数据从零训练,泛化性差,12项任务平均成功率仅3%-6%,仅适用于实验室演示,无通用落地价值。:22889小时第一视角视频,仅训练潜态、动作专家,搭建通用视觉语言先,不使用机器人触觉数据;
2026-07-03 17:15:00
333
原创 顶刊T-RO新成果!中国海洋大学:LLM反馈助力机器人从低质量示范中学习
总体而言,从低质量示范学习到仿真导航训练,再到实体机器人部署,GASL3MF展示了大语言模型反馈驱动机器人自主学习的应用前景,为面向复杂环境的移动机器人导航与具身智能系统提供了新的技术路径。在方法设计上,研究人员首先将示范轨迹中的状态、动作及其执行后的下一状态输入大语言模型,并结合具体任务目标、状态与动作定义以及评价规则,对每一步行为进行评价。研究表明,基于低质量甚至失败示范训练得到的反馈模型,仍能够学习机器人状态、动作与任务目标之间的关联关系,并对示范中未出现的状态—动作组合进行有效评价。
2026-07-03 10:15:00
355
原创 NUS&地平线发布EventDrive:事件相机首次进入自动驾驶决策中心,打通感知到规划全链路
极端长尾场景数据不足;数据集包含31万训练样本、11万测试样本,额外4.2万夜间、模糊极端困难样本,采用半自动化高精度标注流水线,是全球首个打通感知到规划全链路的大规模事件驾驶基准,可统一全行业模型评测标准。EventDrive整合三大真实道路数据源,构建47万组三元配对样本,拆分感知、理解、预测、规划4大类17项驾驶任务,专门搭建低光模糊困难测试集,填补了事件智驾评测基准空白。DSEC、M3ED等现有事件数据集规模小、场景单一,只有底层视觉标注,没有驾驶问答、轨迹规划语言标签,无法训练高阶决策VLM。
2026-07-02 17:12:15
392
原创 【无标题】
分别设计控制器,切换时需要显式的模式识别。本文提出,如果能够实时估计用户的髋关节、膝关节和踝关节力矩,就可以用一个统一的控制框架来处理不同的运动任务,而无需显式的任务分类。系统的核心是一根含有磁性颗粒的软导丝,通过机械臂末端的永磁体来控制导丝在血管中的偏转方向,同时配合导管推进单元实现精确的前进与后退。Science Robotics 的审稿标准要求论文不仅要有技术创新,还要有足够的系统验证和应用前景,这也解释了为什么能在这本期刊上持续发表的团队,往往都具备较强的硬件研发和实验验证能力。
2026-07-02 10:15:00
378
原创 透过ICRA 2026,我看懂了机器人跨本体泛化的三条主流技术路线
▲图6 | 大规模跨本体预训练的WAM框架:语言模型、视频模型与动作模型交替运行,将视频token与动作token交织在同一自回归序列中,通过因果掩码实现时间一致的闭环控制。既然在原始像素空间和底层动作空间里难以实现对齐,不如将视觉和动作映射到统一的隐空间(Latent Space)中,在这个抽象的中间层学习跨本体共享的交互动力学。▲图9 | 动作空间标准化路线的模型输入输出形式:以图像和文本指令为输入,输出离散化的末端执行器动作,通过统一的动作接口实现对多种机器人的控制。
2026-07-01 17:15:00
365
原创 国防科大Nature子刊成果:强化学习+线性嵌入,搞定33种软体机器人构型
近日,由国防科技大学智能科学学院张兴龙、徐昕、胡德文等联合合肥工业大学李霄剑、莫杭杰,纽卡斯尔大学潘为(智身科技CTO),北京航空航天大学文力,慕尼黑工业大学Allois Knoll,南京大学邴振山等研究学者,,材料会变形,气动、负压、柔性肌肉等驱动方式会带来强非线性,不同长度、刚度、装配方式又会让动力学特性发生明显变化。它们像章鱼触手、象鼻、肌肉组织一样,柔软、安全、可变形,能够在复杂环境中完成抓取、交互、穿越狭窄空间等任务。在合适的控制框架下,它同样可以完成高速、动态、实时响应任务。
2026-07-01 10:15:00
357
原创 触觉 GPT 来了?首款跨传感器通用触觉基础模型,泛化性能提升31%
FTP-1 通过MTTS(Morphology-Aware Tactile Token Space)标准化触觉Token空间,把所有触觉信号转化为统一功能表征,搭配独立触觉Transformer,让不同硬件共享通用操作知识,相当于给触觉领域建立一套通用“交互语言”。依托统一触觉表征、异构编码器与独立触觉专家三大创新,基于3000小时混合触觉数据完成预训练,经5家机构分布式实测,实现全新触觉设备零起点高效微调,补齐通用机器人模型在触觉赛道的空白。区别于触觉嵌入视觉主干的方案,FTP-1采用多专家解耦架构,
2026-06-30 17:15:00
357
原创 强化学习必备知识②:机器人运动控制完整pipeline
举个例子,你可以把强化学习想象成训练一只小狗,你不会告诉小狗“先抬左前腿 30 度,再收缩右后腿肌肉”,而是给它一个指令,当它做对了,你就给一块肉干。在数千组极端恶劣的平行仿真环境中完成训练的神经网络,部署至实体机器人后,现实场景中常见的微小扰动与误差,大多不会对其运行造成明显影响。就靠这几个简单的规则,神经网络为了拿到最高分,会在成千上万次的试错中,自动涌现出类似动物的“小跑(Trot)”步态。它根据传感器传来的数据,思考一下,然后给出一个宏观的指令,比如:“所有关节移动到这个新的目标角度”。
2026-06-30 10:15:00
241
原创 2026具身智能大模型:VLM、VLA、VLN、世界模型,谁拿到了王牌?
OctoNav-Bench在连续环境中构建了多模态、多能力混合的自由形式指令-轨迹对,并特别设计了TBA-CoT(Think-Before-Action Chain-of-Thought)数据集,为动作预测提供背后的思考过程。π0.7在未见过的场景中展现出较强的开放性能,包括在多种厨房家电上执行多阶段任务、跨本体零样本泛化(如在未见过该任务的情况下折叠衣物),以及在性能上达到与专门经过强化学习微调的模型相当的水平。这导致模型在面对复杂或模糊指令时,难以进行精确的子任务规划和错误纠正。
2026-06-29 17:15:00
364
原创 机器人顶刊T-RO收录!同济大学:扔掉标定板,实现全自动在线对齐
综合六个公开及真实场景数据集、23种传感器配置以及多项鲁棒性测试结果可以看到,DST-Calib不仅能够实现高精度在线标定,更重要的是首次在大规模跨设备、跨场景设置下验证了端到端LiDAR-Camera在线标定网络的泛化能力。结果表明,得益于多帧联合优化机制,DST-Calib能够有效缓解时序错位带来的观测不一致问题,在存在显著同步误差的情况下仍能保持稳定的标定性能。类似于LiDAR点云的多视角投影过程,虚拟点云能够生成任意视角下的相机观测,从而在相机侧实现高效的数据增强,为“多对多”映射关系提供支撑。
2026-06-29 10:15:00
386
1
原创 将动画思想融入机器人操控:“关键帧+强化学习”玩转铰接工具
该模块专门优化了薄型工具的抓取逻辑,传统抓取算法容易出现手指与工具、地面碰撞,新增的穿透修正机制会在迭代中调整指尖位置,在规避碰撞的同时保证有效接触,适配厚度仅1厘米左右的小型铰接工具。实验表明,轨迹数量、关键帧数量越多,策略鲁棒性越强;研究选取夹子、钳子、注射器、管式夹四类形态、关节特性各异的铰接工具开展测试,设置遥操作、开环轨迹两大基线,从抓取、工具开合等多个维度评估成功率。简单的奖励组合降低了调参难度,搭配仿真环境的多样化样本,让策略不局限于仿真设定的物理参数,具备跨设备、跨工具的适配能力。
2026-06-28 17:15:00
377
原创 重磅!杨立昆团队JEPA首登无人机:纯仿真训练、零样本实机迁移,硬件改动误差降低30%
这类JEPA方案仅在潜空间做高层运动预判,缺少对接控制器的物理转换模块,同时未适配无人机20Hz以上高频控制、SO(3)姿态流形、四电机耦合约束等特殊需求,只能离线推演,无法接入MPPI、NMPC闭环控制器,始终停留在理论验证阶段,难以实装飞行器。更换螺旋桨、加装货物、电机老化、阵风扰动都会改变动力学参数,每次硬件改动都要重新系统辨识、人工调参,高机动飞行下气动力、桨机耦合等非线性效应无法精准建模,长距离飞行轨迹偏移严重,仅能支撑低速悬停场景。优势:架构简单、训练代码成熟;
2026-06-28 10:15:00
387
原创 终极SLAM大一统方案来了!Ultra-Fusion爆杀60+开源系统,刷爆五大benchmark!
论文拓展了此前M3DGR数据集,新增仿真可控退化轨迹,总计37组真实+仿真序列,覆盖暗光、遮挡、狭长几何、车轮打滑、GNSS失锁全部典型故障场景,存储总量超300GB,同时提供仿真精准真值,可人为控制时序、外参扰动,用于校准算法对比。为核心,搭配可观测性自适应初始化、因子级可靠性调度、在线时空双校准三大配套模块,任意传感器组合共用一套状态、边缘化、求解逻辑,不需要分系统调度。当然,这套框架属于定位底层基础模块,要真正适配高阶自动驾驶、复杂动态环境,还需要叠加动态目标处理、回环检测、语义地图等上层模块。
2026-06-27 17:15:00
468
原创 港大&华为开源World Engine:加塞碰撞降45.5%、200km零接管!
但无论如何,World Engine代表了一条清晰的路径:把大模型的后训练范式搬进自动驾驶,让模型在与世界引擎的闭环交互中持续进化——而这,可能是解决长尾问题最务实的方向。二是算力规模化——用更大的集群训练更大的模型。这两条路径对常规场景行之有效,但在长尾场景上会遇到收益递减的问题——这正是World Engine试图回答的核心。World Engine生产模拟人类驾驶的物理世界——真实多智能体互动的模型,相当于给自动驾驶提供了一个真实虚拟世界对抗训练的场地,通过后训练快速提升算法能力。
2026-06-27 10:15:00
350
原创 Yann LeCun团队最新:仅靠“时序因果”做自监督,开辟视觉预训练“第三条路”
放在当下自监督视觉赛道来看,这项工作跳出了行业固化的优化思路:过去所有SOTA模型都在不断微调增强、掩码策略来平衡特征语义与空间能力,而TDV直接证明,所有人工设计的数据变换本质都是人为约束,数据规模扩大后会成为性能天花板。主流DINO、iB预训练流程,依赖多组全局、局部裁剪+全套色彩、模糊增强;这里需要客观区分:因果假设并非万能捷径,它只是目前已知最弱、跨模态通用的底层规律,不会主动丢弃色彩、位置、运动等任意视觉信息,不会给下游任务设置先天限制,但代价是缺少语义引导,物体分类能力自然偏弱。
2026-06-26 10:15:00
303
原创 CMU团队提出RT-VLA:双分支解耦+多级蒸馏,让端到端自动驾驶模型提速44倍!
它没有为了极致速度过度牺牲模型能力,而是通过分层知识迁移,让轻量化模型完整继承大模型的驾驶逻辑与语言推理能力,同时依靠架构拆分,实现实时控制与离线解释各司其职。需要客观看待的是,该组实验均在仿真环境中完成,数据集路况、光照、干扰因素经过标准化处理,和真实复杂道路存在域偏差,仿真高分不能直接等同于实车表现,仅能证明算法架构的有效性。整体而言,RT-VLA不仅为自动驾驶VLA模型提供了轻量化落地思路,其多级蒸馏与分支解耦的设计,也可迁移至机器人、智能座舱等其他大模型应用场景,具备较强的参考价值。
2026-06-26 10:15:00
343
原创 四年十篇顶会Best Paper,谁在持续霸榜?
它的核心创新在于一种新颖的查询机制,允许模型独立、灵活地探测时空中任意一点的3D位置,避免了密集的逐帧解码。:自然界中的运动——树叶的摇曳、花朵的颤动、蜡烛的跳动——遵循着特定的物理规律,这些运动往往是振荡性的、可预测的。Generative Image Dynamics提出了一种对图像空间场景运动建模的生成先验,通过在频域(傅里叶域)中学习运动的"频谱体积"(Spectral Volume)表示,能够从单张静态图像中生成无缝循环的动态视频,或允许用户通过拖拽与图像中的物体进行交互式动态模拟。
2026-06-25 17:15:00
239
俞刚-物体检测的过去、现在和未来.pdf
2020-09-07
矩阵指数与对数运算的实现
2014-10-09
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅