• 博客(849)
  • 资源 (1)
  • 问答 (1)
  • 收藏
  • 关注

原创 具身智能、端到端、自动驾驶、大模型......技术交流群汇总

深蓝学院搭建了16个领域的交流群(具身智能、端到端、自动驾驶、机器人、大模型......等等),小伙伴们可以在群内交流、分享问题、获取行业资讯。这样在各大企业工作的,可以相互内推,互通信息;在学校读研读博的,可以交流想法,携手合作。截至目前,我们的社群已经细分到了【16】个子方向的领域,并且还在不断地壮大规模!不限学校、不限专业,只要你是人工智能相关行业的人就能加入(社群内会有。的面试题以及论文资源,还有相关领域的小伙伴一同学习、交流!所以,如果你想要跟更多优秀的小伙伴扎堆学习成长,后台私信。

2025-11-17 10:28:42 350

原创 2024年自动驾驶规划控制面试及答案

A*吸取了Dijkstra 算法中的cost_so_far,为每个边长设置权值,不停的计算每个顶点到起始顶点的距离(G),以获得最短路线, 同时也汲取贪婪最佳优先搜索算法中不断向目标前进优势,并持续计算每个顶点到目标顶点的距离(Heuristic distance),以引导搜索队列不断想目标逼近,从而搜索更少的顶点,保持寻路的高效。DWA,TEB算法。通常情况下,在机器人高速运动的时候,想要得到非常连续、平滑、噪音低的运动控制,第3个约束条件是必不可少的,有的甚至还要求加速度的导数jerk都是连续的。

2024-07-22 18:43:12 1871

原创 最大误区:Sim-to-Real 不是训完之后的事情!从辨识到适应,这些工作贯穿全程

Sim-to-Real 迁移的首要工作,并非直接调整策略或扩大随机化范围,而是先将这个Gap进行分解,判断其来源:哪些应当通过辨识与前馈直接消除,哪些只能依靠策略的鲁棒性来覆盖。▲图5 | ANYmal 的训练框架将“训练时可见的特权信息”和“部署时能获得的本体感知”分开处理:教师策略先利用完整仿真信息学习,再把能力迁移给只依赖真实可用观测的学生策略。系统保留了行走、跳跃、攀爬和低姿穿越等独立的专门技能,由高层导航策略根据视觉感知结果,动态选择并衔接合适的底层技能,而非将所有动作融合为单一控制器。

2026-07-31 17:15:00 58

原创 南洋理工、小米汽车、浙大提出 GeoWorldAD:让自动驾驶在三维空间中“看见当下、预判未来”

部分世界模型虽然能够预测未来图像,却需要在信息冗余的 RGB 空间中学习场景演化,生成的未来表征也未必能够为轨迹规划提供直 接、有效的几何指导。这类方法直接从图像或视频中学习驾驶策略,减少了传统感知、预测与规划模块之间大量人工设计的接口,借助transformer架构和海量的训练数据,取得了显著的效果。仅仅加入几何预训练并不能自动带来可靠规划。对于世界模型自动驾驶而言,这也提供了一个值得关注的方向:相比在 RGB 空间生成完整未来画面,直接预测与行动更相关的几何状态,可能是一条更紧凑、更明确的规划路径。

2026-07-31 10:15:00 252

原创 登Science Robotics首页!三阶段真实世界强化学习框架 RL-100,任务成功率高达100%

以人类遥操作采集的轨迹数据初始化扩散视觉运动策略,输入包含RGB图像或3D点云观测、机械本体关节感知、连续动作序列,扩散网络以噪声预测损失训练,同时加入重建、变分信息瓶颈正则项,避免视觉表征漂移。动态T推块、敏捷保龄球、颗粒倾倒、灵巧手拧螺母、双臂软毛巾折叠、橙子榨汁(放置/取出)、纸箱折叠,涵盖刚体、流体、可变形布料、精密装配、双臂长时序协同。(双臂折叠、精密装配)两类执行模式,共用扩散主干网络,仅输出头区分,一套框架适配UR5、Franka、xArm、灵巧手全品类机械硬件。

2026-07-30 17:15:00 314

原创 独家 | 50 所国内具身智能实验室盘点(附全景图)

信息均由深蓝具身智能团队手动整理,虽经多方核对,或有疏漏之处,欢迎各位在评论区补充指正。文末获取国内具身智能实验室全景图(海外篇正在路上)。划分依据公开产学研现状归纳,边界存在交叉,仅作参考,非官方定性界定。等底层科学问题上,承担着关键性技术攻关与长期学术储备的任务。企业提供场景与工程化能力,高校提供前沿算法突破,02 校企协同共建,合作型科研团队。这些实验室是具身智能的“基础研究腹地”。据不完全统计(海外实验室盘点见下篇)将研发周期前置,共享核心知识产权。这里的合作建立在具体的。

2026-07-30 10:15:00 222

原创 苏黎世联邦理工提出 EgoHTR:野外 4D 人体-地形对齐,把人类动作重新放回真实地形

他们用惯性动捕服记录身体运动,用第一视角智能眼镜提供全局轨迹,再用便携式 3D 扫描仪重建环境,把人体姿态、脚部接触和场景几何对齐到同一个坐标系中。▲图6 | 团队先将场景中的 SMPL-X 人体动作迁移到 Unitree G1 的身体结构,并在对应的碰撞场景中检查动作与环境的几何关系;人体 SMPL-X 网格位于统一场景坐标中,脚部接触可以逐帧获得,第一视角和部分外部观察视角能够同步对应,场景还提供可用于碰撞检测和机器人训练的高分辨率三维几何。其次,当前流程假设场景是静态的,不能处理可移动或可变形物体。

2026-07-29 17:15:00 333

原创 覆盖 200 万平米!影石 PanoLOG 如何让大场景 3DGS 真正可并行?

技术展望角度看,全景重建要解决的,是如何更高效地把真实世界转化为结构一致、可自由浏览的三维表示,而这正是自动驾驶仿真、数字孪生、具身智能与世界模型共同需要的底座。围绕这一判断,影石创新的方案是先建立可靠的、全局性质的粗三维几何,再通过几何与梯度分块策略(即:G²PS)来选择真正重要的相机,让各分块重新获得独立优化和并行扩展的能力。无人机采集的待重建户外大场景,是检验本文方法的关键。在这篇文章的全部场景中,PanoLOG 均取得了领先的重建质量,同时保持更高的训练效率和更优的模型规模。

2026-07-29 10:15:00 297

原创 李飞飞最新力作:15小时数据搞定双向机器人世界模型!跨机器人本体零样本泛化

模型见过机器人抓东西抓到,也见过机器人抓空——反事实的数据让它学到的不只是"这样动会怎样",也包括"这样动不行"。视频模型要做的,就是把灰色区域里的内容补全——该动的物体让它动,该静止的背景让它静止。没有编码器,没有数值向量到视觉信号的翻译层,没有任何新模块——就是把动作变成了视频模型本来就会处理的"掩码补全"任务。跨本体泛化的代差,来自信息量的代差。15小时微调、单模型双向推演、跨本体零样本三大特性,大幅降低通用机器人世界模型落地门槛,给具身智能通用模拟器提供一条轻量化、高泛化的全新技术路径。

2026-07-28 16:50:11 321

原创 盘点 | MIT何恺明团队2026年硬核成果:把生成模型的底层逻辑重新捋了一遍

然而,ELF 的对比基线主要是其他扩散语言模型,而非当前最先进的自回归大语言模型(如 GPT-4o 等),因此其在实际语言生成任务中的绝对水平,仍需更全面的对比评估。在 ImageNet 上,BiFlow 与其因果解码对应版本相比,在提升生成质量的同时,将采样速度提升了最多两个数量级,并在基于归一化流的方法中取得了最优结果,在单次评估(1-NFE)方法中也具有竞争力。图7 | ELF 的训练与采样流程。左侧为不同时刻 t 下的噪声图像,中间为网络预测的平均速度(蓝色),右侧为对应的去噪图像预测(橙色)。

2026-07-28 10:15:00 297

原创 顶会 RSS 2026 释放明确信号:8篇力作聚焦底层控制、轨迹优化、物理硬件

从今年的 RSS Final List 中,无论是 FlashSAC 在高维强化学习上的效率革命,Muninn 在扩散模型推理上的缓存加速,还是 NeuralActuator 对底层电机的神经感知化,这种“由粗到细”的解码方式,不仅保持了较高的动作保真度,还赋予了机器人在推理时动态取舍速度与精度的能力,为高频动作生成提供了一种极具潜力的分词范式。减少梯度更新次数,转而利用更大的模型和更高的数据吞吐量,并对网络权重、特征和梯度施加严格的范数约束,从而在保持稳定性的同时大幅缩短训练时间。

2026-07-27 10:15:00 324

原创 上交大秦通团队提出 VLN-AVP:不用高精地图、首次进车库就能泊车,真车部署已验证

这个设计在成本上的收益是实打实的。图2 | VLN-AVP 的快慢分工:高频 BEV 感知生成车辆运动学可行的候选路线,低频 VLM 根据自然语言和记忆决定方向,层级模块再选择实际执行的轨迹。曲线反映的是论文单场景重复试验的趋势,而非所有车库的通用承诺。但真正让行业头疼的,是地图覆盖不到的地方:一个从没去过的陌生车库,或者用户突然来一句"找个带充电桩的""停离出口最近的位置"。在已有高精地图的车库里,认路问题已经被工程化解决得差不多了——输入"B2层31号",车辆沿着地图规划好的路径开过去就行。

2026-07-26 10:15:00 351

原创 机器人逆运动学(IK)到底在算什么?五个关键点从数学本质到工程落地

更麻烦的是,就算出口存在,找到它的路径本身就是一个非线性的高维搜索问题,在某些特殊位置,搜索的"地图"会直接失效。具身智能时代让 IK 的重要性再次上升:当机器人需要在非结构化环境中完成开放任务,IK 不再只是一个控制模块,而是连接感知、规划和执行的核心接口。本文尝试从数学本质出发,走完解析解→数值解→现代方法→工程落地这条完整的链路,并在关键节点给出可执行的伪代码和核心公式。:传送带节拍 ≤ 0.5s,IK 必须在 ≤ 1ms 内给出关节角,还要从多解中选无碰撞最优解。

2026-07-25 17:15:00 376

原创 端到端自动驾驶:十大前沿算法盘点

Senna 证明了,在现阶段,让语言模型做它擅长的语义推理,让专用网络做它擅长的数值计算,是提升端到端系统鲁棒性的最佳路径。EMMA 在 nuScenes 和 Waymo 开放数据集上均展现出了极强的竞争力,并能输出详细的“驾驶理由”,为黑盒的端到端模型提供了难能可贵的可解释性。这种高度统一且并行的架构,不仅极大地简化了端到端系统的设计,避免了误差累积,还展现出了卓越的训练稳定性。该架构将 VLM 的低频深度思考与传统感知规划系统的高频实时控制相结合,既保证了对复杂场景的理解力,又兼顾了系统的实时安全性。

2026-07-25 10:15:00 361

原创 小鹏自研视觉基础模型发布!只用10%数据,“干翻”谷歌百亿模型

在统一VLM训练流水线下(Qwen2.5-1.5B作LLM骨干),TuringViT-24L在目标定位(RefCOCO 90.4 vs 88.9)、OCR(OCRBench V1 798 vs 781)、通用VQA(MMVet 49.1 vs 47.0)上均优于SigLIP2-L。为小鹏的智驾、座舱、人形机器人三大业务,打造一个成本可控、场景可控、性能领先的统一视觉底座。这种“原生支持”的设计,彻底消除了预训练和下游应用之间的鸿沟,无需任何额外的插值或适配操作,模型就能即插即用,性能和效率都达到最优。

2026-07-24 10:15:00 368

原创 世界模型的第一篇论文,比GPU的出现早了九年。

未来,随着两大技术路线持续融合、仿真迁移精度不断提升,世界模型将彻底重构人工智能的发展格局,也许真的会成为复刻我们所在的这个世界的平行宇宙,甚至会发现我们没有发现的我们的世界的规律,因为被世界模型自己学习到了。世界模型训练时不再拟合理想化虚拟物理,而是学习真实世界的随机性、不确定性、微小扰动,让虚拟环境的物理规律、场景分布、故障模式与现实世界无限对齐,实现虚拟训练策略零适配迁移到真实硬件。世界模型完全遵循大模型缩放定律,数据量、参数量提升,推理精度与真实度稳定上涨,为行业规模化迭代提供理论支撑。

2026-07-24 10:15:00 323

原创 港科大谭平团队开源Glob3R:打通前馈模型与全局SfM壁垒,四大数据集全面SOTA!

指标为轨迹RMSE(单位cm,越低越好),Glob3R平均RMSE=3.2,和最优基线AMB3R持平,在旋转频繁、基线狭小的室内场景稳定性拉满,弱纹理房间序列误差显著低于DROID-SLAM、MASt3R-SLAM等视觉SLAM方案。整体流程如图所示,输入有序视频或图像检索生成伪序列,分滑动窗口局部预测、多视图轨迹生成、全局统一优化三大部分,整套架构仅微调新增匹配分支,Pi3X主干完全冻结,训练、推理成本可控。Glob3R依靠重叠关键帧把全序列轨迹串联,所有图像统一参与后续全局优化,从根源抑制分段漂移。

2026-07-23 17:15:00 324

原创 Science Robotics 7月封面 | 仅靠机载设备,用一套强化学习跑出野外6m/s极限越障

分层强化学习HRL将不同障碍对应独立专家策略,切换时容易出现动作断层,且每个技能都要单独训练,新增障碍场景需要重新迭代,同时多数方案依赖外部动捕定位,脱离实验室环境直接失效。综合来看,小跑低速稳定性强、能耗更低;冻结共享编码器,分别训练小跑、奔跳两套解码器,输入隐向量直接输出12维关节扭矩,省去额外轨迹跟踪RL阶段,传统方案普遍需要二次强化学习适配扭矩输出。研究对比了小跑、奔跳、对角溜步、疾驰、弹跳五种步态,在台阶、高台、乱石、踏石地形的成功率、速度跟踪、运输成本(COT)三大指标。

2026-07-23 10:15:00 355

原创 盘点 | 香港科技大学沈劭劼团队2026上半年硬核成果

在此基础上,研究人员设计了一种高效的深度渲染方法:利用随机实体的体积特性,通过二分搜索定位透射率为0.5的中值深度,并推导出对应的闭式梯度表达式,实现了端到端的可微优化。通过视觉几何基础的约束,VG3S 显著提升了3D高斯表达在语义占据预测上的准确性,并在 nuScenes 占据基准测试中取得了显著的性能改进,为基于纯视觉的高级场景理解提供了新思路。通过高效的两级分解策略,FC-Vision 在保证实时性的前提下,强制执行密集的表面可见性约束,从而显著提升了未知环境下的扫描质量。

2026-07-22 16:55:17 297

原创 机器人控制算法八大体系详解:从 PID 到强化学习

原理是机器人每个时刻,基于动力学模型预测未来一小段时间窗口内的运动轨迹,结合电机限位、避障等硬件约束求解最优控制序列,仅执行当前第一步指令,下一时刻重新预测、重新优化。根据目标轨迹的期望位置、速度、加速度,通过动力学方程逆解,直接求解关节所需的理论力矩作为前馈量,再叠加少量反馈修正偏差,侧重前馈驱动,闭环修正能力弱于CTC。广泛应用于户外移动机器人、重载机械臂等复杂工况。鲁棒,想必大家非常熟悉了,是robust健壮的意思,也可以理解为健壮性控制:你踢一脚正在步行的机器人,它不会摔倒马上回正,就是健壮性。

2026-07-22 10:15:00 583

原创 视频通用模型来了!何恺明等新作GenCeption:训练量仅1/500,精度持平SOTA!

通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新,实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务,数据效率远超传统自监督与专用模型路线,同时诞生仿真到真实、跨类别零样本等涌现能力。整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干,核心改造思路是抛弃扩散迭代采样,将多步去噪流程转为单步前馈推理,搭配统一表征方案、合成数据多任务微调流水线,全程一套主干、一套损失搞定所有视觉任务。

2026-07-21 17:15:00 312

原创 自动驾驶核心算法盘点|目标跟踪与轨迹预测篇

它不再直接预测 3D 边界框,而是先在鸟瞰图(BEV)上预测目标的“中心点”,同时附带预测目标的速度。在跟踪阶段,由于目标变成了点,系统只需要拿上一帧的中心点加上预测速度,得到当前帧的预期中心点,然后与当前帧检测到的中心点进行贪心最近邻匹配(Greedy Closest-Point Matching)。:AB3DMOT 证明了在高质量 3D 检测器的加持下,仅靠极其简单的 3D 运动学模型就能实现优秀的在线跟踪,且在 KITTI 数据集上速度高达惊人的 207.4 FPS。

2026-07-21 10:15:00 323

原创 商汤开源SenseNova-Vision:一套模型通吃检测、分割、深度、3D重建四大核心视觉任务

此前NLP依靠统一生成范式完成大一统,视觉领域长期任务割裂,SenseNova-Vision以统一多模态生成为底层逻辑,不依赖任何任务专属网络,一套主干通过语言指令完成数十类视觉感知任务,同时开放大规模多任务数据集。,依托通用多模态大模型原生文本、图像双生成通道,将目标检测、OCR、关键点、分割、单目深度、法线、多视图重建、相机位姿等全品类视觉任务整合至同一主干。主干基于Bagel-7B-MoT多模态模型微调,不新增专属解码器,仅优化数据流水线,整体分为统一输出范式、SN-VC数据集、混合任务微调三部分。

2026-07-20 16:55:13 383

原创 通俗讲透机器人正向运动学:从原理到工程实例,一次性讲明白!

这条完整链路。它是理解后续逆运动学、动力学、轨迹规划的前提:具身智能的每一层上层能力,都建立在这个看似枯燥的正运动学基础之上。

2026-07-20 10:15:00 312

原创 自动驾驶的长尾分布怎么解决?

而视觉语言动作端到端驾驶模型则实现了长尾处理能力的原理级突破,依托图像、文本、动作的跨模态对齐能力结合通用常识推理,具备强大的零样本泛化能力,可自主识别从未训练过的各类长尾目标与工况。自动驾驶技术的落地普及,核心瓶颈不在于常规路况的稳定通行能力,而在于真实道路中层出不穷的极端、稀有、非常规场景——这类场景对应的技术难题,正是行业普遍关注的长尾分布问题。在训练均衡优化层面,通过重采样、动态样本加权、代价敏感损失函数等方式,对占比极低的长尾样本赋予更高损失权重,强制模型兼顾常规场景与稀有场景的学习优化。

2026-07-19 10:15:00 310

原创 北大团队FSD-VLN:用“慢系统”管语义、“快系统”管飞控,未知环境导航成功率翻倍!

虽然当前仅停留在仿真验证阶段,距离真实复杂户外部署仍有优化空间,但这套快慢分离的双系统设计,为后续低空无人机语言导航提供了全新范式,有效化解“语义深度”与“控制延迟”长期无法兼顾的行业矛盾,对轻量化机载自主视觉导航工程落地具备极强参考意义。本次实验全部基于AirVLN-S、OpenFly大型低空仿真平台,采样4类虚拟城市场景(城区、工业区、公园、乡村),叠加广州城市仿真场景,合计3万+导航轨迹,轨迹长度集中50-150米,单次导航动作20-50步,完全匹配真实巡检飞行工况。

2026-07-18 17:15:00 380

原创 深圳新规实施!华为、小鹏、理想的L3落地比我们想象的要难得多......

当一辆车在高速上跑了两个小时,系统一直表现得很稳,驾驶员早就放松了,可能在刷手机,可能在打盹。更麻烦的是,L3 还需要整车的硬件冗余——转向系统、制动系统、算力平台,每一套都要有备份,任何一个环节出问题,系统都要能自主处置。L3 是走向 L4 的必经阶段,不能跳过,因为只有通过 L3 的规模化运营,才能积累到足够多的极端场景数据。L3卡了七年,根本原因从来不是技术不够酷,也不是法律不够新,而是它本身就站在一个尴尬的十字路口——系统强大到让人放松警惕,却又脆弱到在关键时刻需要人挺身而出。

2026-07-18 10:15:00 229

原创 小米机器人发布380亿参数具身生成模型,83倍提速,全量开源

在研究给出的单张 H20 GPU、1024×1024 T2I 设置下,单图时延由标准 AR 的 450.77 秒降至 FlashAR+ 的 16.56 秒,加入 vLLM 后进一步降至 5.44 秒,对应最高约 82.9 倍加速。▲WorldArena 排行榜为 U0 的视频生成能力提供了补充证据,但它衡量的是生成视频的质量、运动、内容、物理、三维关系和可控性,不等同于真实机器人的长期闭环控制能力。如果只在机器人轨迹上继续训练,模型很容易适应狭窄的实验室分布,却损失原有的语义理解和图像编辑能力。

2026-07-17 17:15:00 323

原创 港科大沈劭劼团队CO-Calib:多鱼眼标定成功率从68.1%拉到99.3%,Kalibr终于不崩了

车载环视、无人机全景、VR全景设备普遍搭载多鱼眼相机,但行业长期存在一个工程痛点:同样一套标定流程,窄视场相机一次就能跑完,换成220°、240°超广角鱼眼,十次标定七八次直接优化发散、参数失效。,不改动现有BA优化后端、不修改鱼眼相机模型,只在标定输入素材前做两步处理:基于学习的高精度标定板检测器、误差导向智能帧筛选器,三步分层筛选标定帧,自动生成解耦内参、多相机共视约束素材。2. 只有两项指标达标帧才作为初始化锚点,优先放入标定序列,保证内参初始化阶段条件数保持低值,从根源杜绝病态更新。

2026-07-17 10:15:00 354

原创 ECCV 2026 | 香港理工大学:面向高速动态物体操作的3D世界模型

速度优势源于架构精简:FreeGave 607ms/帧,PhysMani仅205ms/帧,且PSNR曲线全程高于FreeGave——不是"以速度换质量"的取舍,而是"又快又好"。需要客观看待的是,真机实验规模较小(每项仅16试次),且使用Astribot S1这台性能较强的机械臂——在更廉价、精度更低的机械臂上能否复现,论文没有验证。PhysMani做了一个定位清晰的减法:不追求VLA的"大而全",不走视频世界模型的"看着好看但不管用"路线,而是把“物理上正确的3D未来预测”作为唯一核心,

2026-07-16 10:15:00 316

原创 影石新作PanoWorld:8秒生成161帧全景视频!比3D重建轻、比隐式记忆稳

当下全景生成赛道里新工作密集、同质化严重,PanoWorld 真正值得写的不是又刷了一轮分,而是它从头重新定义了问题的方式——这恰恰是决定一项工作能不能在拥挤赛道里站住的关键。但这两类都带着"透视相机"的假设,没把全景数据的特殊性当回事——360° 画面畸变严重,一点旋转就会带来视角大漂移,于是记忆检索在严重畸变和旋转视角下错位,越回忆越乱。打通了"文本→全景视频";它更像是"用速度和可扩展性,换显式 3D 的逐点精度"的那一档,也是目前少有的把"全景旋转等变性"真正落到记忆机制里的工作。

2026-07-16 07:15:00 333

原创 浙大FLOAT:不倾斜机身、不倾转旋翼,2cm缝隙里稳稳拉抽屉,突加200g载荷不炸机

它证明了,通过巧妙的机械设计与深度的非线性控制相结合,无人机完全可以像一个克制的绅士,在不破坏环境的前提下,精准地完成物理操作。在机身保持水平的状态下,FLOAT 稳定拉出了 5.42 N 的横向力,这为其在狭窄空间内执行推拉任务提供了充足的动力储备。在抽屉推拉任务中,把手和前面板的间隙只有 2 cm,如果高度误差超过这个数值,挂钩就会直接撞在柜子上,任务直接宣告失败。给出了一个巧妙的解法——不靠倾斜机身,也不靠倾转旋翼,而是在旋翼下方的下洗气流中布置伺服驱动的控制面来“拨动”气流。

2026-07-15 17:15:00 313

原创 横扫10大AI顶会“最佳论文”的学术巨擘:他们是谁?

他包揽了3次ICRA最佳论文主奖。这10大顶会的Best Paper不仅是对过去一年最杰出研究的褒奖,更是通向通用人工智能(AGI)道路上的一座座里程碑。从CVPR、ICCV、ECCV到NeurIPS、ICML、ICLR,再到机器人领域的ICRA、IROS、RSS、CoRL,这10大顶会见证了从深度学习爆发到大模型涌现,再到具身智能落地的全过程。在人工智能与具身智能飞速发展的今天,顶级学术会议的“最佳论文(Best Paper Award)”不仅是学者个人荣誉的巅峰,更是整个领域技术演进的“风向标”。

2026-07-15 10:15:00 187

原创 宇树G1登上Nature!全球首例人形机器人完成活体手术

更实际的是,大多数手术室最初为手动手术设计,da Vinci的docking需要额外空间,不是所有医院都能部署。头部摄像头检测trocar上的ArUco标记,实时估计RCM位置,通过逆运动学求解器将医生给出的器械尖端目标位姿映射为机器人腕部关节运动。FLS分数差距确实大,但da Vinci Xi是数十年迭代的成熟商业产品,人形平台用的是研究阶段的G1,不在“同一条起跑线上”。另一个值得注意的数据:高级外科医生在人形平台上的FLS分数93.57,与da Vinci Xi的98.69。

2026-07-14 17:15:00 358

原创 VLA首次搞定真实家具组装!牛津大学突破1500步长时序双臂协同瓶颈

当进度超过阈值(τ=0.95)且通过简单高频滤波(连续两帧都超阈值,或隔几帧再次触发),系统自动切到下一子任务指令,重置进度、清空动作缓存,不需要外部状态估计器。,各子任务成功率在67%~87%之间,远高于完整组装的40%,进一步确认失败模式是子任务间误差累积,而非某个环节无法完成。刚完成组装的接触状态极不稳定,微小的执行误差会让下一子任务的起始分布变得很宽,进入没见过的状态空间、开始漂移。而机械臂撤退到远离家具的悬停位置后,无接触、无受力约束,小偏差不会放大,每个子任务的起始状态更窄、更一致。

2026-07-14 10:15:00 347

原创 NVIDIA最新“论证”!当前主流的端到端路线,在持续学习上是否存在根本性的缺陷?

▲不断扩展的技能库 | ASPIRE 维护着一个不断增长的技能库,该技能库将经过验证的修复方法提炼成模块化的、可转移的机器人知识,这些知识可以作为未来任务的上下文指导进行检索。真正值得期待的,是一个能让两者协同工作的系统:模型负责感知和动作,技能库负责经验和记忆,机器人在每一次成功和失败中都能积累下真正有用的东西,而不是让经验随着任务结束一起消散。但光是“用代码控制机器人”并不新鲜,ASPIRE 真正关键的一步,是把每次调试成功的经验提炼成一条可复用的技能,存进一个共享的技能库。

2026-07-13 17:12:38 336

原创 只用公开数据,强化学习后训练让VLA成功率提升13个点

Z-1没有提出新算法,GRPO是DeepSeek的老方法,π0.5是现成模型,RoboCasa是开源平台,它做的是把这些已有组件组合成能稳定跑通的RL后训练pipeline,每一环都给出可复现的工程方案。同组8条全成功时,标准GRPO用组内均值归一化,比均值慢的成功轨迹拿到负优势,等于惩罚"虽然慢但成功了"的轨迹,把策略推向激进加速。主流方案默认冻结视觉语言模块只更新动作专家。VLA的RL后训练是2025年下半年爆发的方向,πRL、ReinFlow、VLA-R1、SimpleVLA-RL都在做类似的事。

2026-07-13 10:15:00 650

原创 强化学习求解逆运动学,这五类方案值得重点关注!

传统双臂IK需要联立两组运动学方程求解耦合变量,方程维度叠加后求解复杂度指数上升,该类多智能体强化学习方案拆解耦合运动学约束,通过多智能体奖励博弈完成协同IK求解,适配桌面级协作机械臂实物调试。从运动学理论来看,该架构实现「数据驱动正模型+梯度驱动逆求解」闭环,完成无精准DH参数、非线性形变设备的逆运动学求解,适配软体连续体机器人、磨损非标工业机械臂作业场景。传统求解算法仅能输出局部范围内的关节角度方案,强化学习依托环境试错搜索,可以遍历空间内多组可行关节解,适配冗余七轴机械臂、双臂协同机器人的求解需求。

2026-07-12 10:15:00 366

原创 动态SLAM的“既要又要”难题,DL-SLAM用像素层+物体层双层概率解决了

问题是,一个站在路边不动的人,对SLAM来说就是一堆高质量的几何约束——他的轮廓、深度、纹理全可以用,非要把人家删了,纯属浪费。最终像素的动态概率不仅来自几何误差,还做了语义层面的聚合——同一个物体实例上的像素共享运动状态,取前四分位数和中位数的平均值作为该实例的整体概率,避免个别误判像素带偏整体判断。DL-SLAM的做法是:物体级删除完成后得到一个纯净的静态地图,用这个纯净地图渲染一张"它认为正确的概率图",然后把这张渲染图作为先验,用贝叶斯公式更新原来的像素级概率。

2026-07-11 17:15:00 334

原创 自动驾驶核心算法盘点|规划与控制篇

蓝色虚线为动态规划给出的粗略速度曲线,绿色虚线为二次规划在可行域内平滑后的最终速度曲线,图中可见"follow-yield(跟车让行)"与"overtake(超车)"两种决策对应的不同可行区域。预测输出(黄色点)会逐渐逼近参考轨迹(红色曲线),但控制器只执行当前时刻的第一个指令,随后在下一时刻重新滚动求解,以应对实际状态与预测的偏差。图中定义了车辆相对于目标路径的横向偏差 (车辆质心到参考路径的垂直距离)和航向偏差 (车辆朝向与参考路径切线方向的夹角),这两个量构成 LQR 控制器的核心状态输入。

2026-07-11 10:15:00 369

俞刚-物体检测的过去、现在和未来.pdf

物体检测是计算机视觉的基础环节,对于很多计算机视觉任务的落地和研究都有非常重要的意义。本次分享主要从物体检测的问题切入,讨论物体检测的发展历程,从传统视觉年代,到深度学习时代的变革,到未来的发展趋势。也会分析工业界的落地发展历程,从传统时代的人脸检测到通用的物体检测。

2020-09-07

一个半月吐血整理,各大厂500+求职者分享,1000+面试真题及经验收

真题题库、行业交流群已准备就绪! 大家三连后,评论区留言获取!

2022-09-16

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除