自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1836)
  • 收藏
  • 关注

原创 Dyna-2:世界-动作模型的百万小时规模化定律(上)

26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。

2026-08-31 00:15:00 147

原创 Dyna-2:世界-动作模型的百万小时规模化定律(下)

26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。

2026-08-31 00:15:00 198

原创 GEN 1.5发布:具身基础模型作为单样本学习者

26年8月Generalist AI发布GEN 1.5 “embodied foundation models as one-shot learner”: https://generalistai.com/blog/gen-1.5。人类拥有惊人的能力,仅凭一个或几个例子就能掌握新的物理技能。最新的机器人基础模型 GEN-1.5 也展现出这种能力的雏形:它无需梯度更新或微调,仅凭一个例子就能在几秒钟内学习一项新任务。它在单样本和少样本演示学习以及零样本物理泛化方面都展现出广泛的能力。尽管这些任务简单且周期

2026-08-30 09:50:57 335

原创 S1简介:面向机器人的上下文学习

来自26年8月SKILD公司的博客“Introducing S1: In-Context Learning for Robotics”:https://skild.ai/blogs/s1。语言建模的演进为将功​​能强大的模型转化为实用的通用工具提供了蓝图。早期基于Transformer模型的方法,例如BERT(Devlin,2019),已被证明能够有效地理解语言,但每个新的应用仍然需要额外的数据收集和模型微调。从早期语言模型到ChatGPT的关键性转变,是由一种截然不同的学习范式的出现所驱动的,这种现象被

2026-08-30 09:10:12 292

原创 基于长短期反思优化的可演化具身智能体在机器人操作中的应用

26年4月来自平安集团技术公司的论文“Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization”。实现通用机器人需要赋予机器人根据环境和反馈进行适应和进化的能力。传统方法面临诸多局限性,例如训练量大、跨任务泛化困难以及缺乏可解释性。提示学习为无需大量训练、仅需反思过往经验即可实现机器人自我进化提供了新的机遇。然而,如何从任务的成功和失败中提取有意义的见解仍然是一个挑战。

2026-08-26 00:15:00 404

原创 ImageWAM:世界-动作模型真的需要视频生成,还是只需要图像编辑?

26年6月来自上海交大、东方理工、腾讯、清华和中关村学院的论文“ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?”。世界-动作模型(WAM)通常依赖视频生成来连接视觉世界建模和机器人控制。然而,基于视频的WAM面临三个相互关联的限制:密集的多帧未来标记使得推理成本高昂;完整的视频预测会将资源消耗在与动作无关的时间和外观细节上;而长时程的未来想象可能会引入误差,从而误导动作预测。这些问题

2026-08-25 10:27:11 387

原创 EmbodiSkill:面向自演化的具身智能体技能-觉察反思

26年7月来自南京大学、华中科技、微软研究院、中科大和清华大学的论文“EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents”。具身智能体可以从指导物体搜索、动作执行和状态变化的技能中获益,这些技能可以应用于各种不同的环境。由于具身环境在布局、物体状态和其他执行因素方面存在差异,这些技能必须从任务执行过程中生成的轨迹中自我演化。然而,现有的技能自我演化方法主要在数字环境中开发,并且通常将轨迹转换为粗略的技能更新。直接将这种

2026-08-25 09:20:43 354

原创 Zetta [特殊字符]:一种自演化物理智能的高效闭环具身驾驭

26年8月来自清华和Z- Brain的论文“Zetta 𝜁: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence”。具身智能体正日益被用于弥补端到端策略模型的不足。然而,智能体路径尚未在物理执行中实现闭环学习:现有的智能体平台大多仍是开环的,在部署过程中遵循固定的技能,仅在回合结束后才进行反思。这种事后反思无法在执行过程中进行有效控制,因为物理交互需要决策者以远超当前大型智能体模型的频率跟踪

2026-08-24 11:46:20 701

原创 通过技能-驾驭进化实现自我演化的具身智能体

26年8月来自美国东北大学和微软研究院的论文“Self-Evolving Embodied Agents via Skill-Harness Evolution”。具身智能体越来越多地被构建成围绕基础模型的系统,其性能不仅取决于模型权重,还取决于模型周围的技能、上下文、动作接口和执行驾驭。虽然监督式微调和强化学习可以使智能体适应新环境,但它们需要额外的数据、奖励和训练次数;同时,许多无需训练的、以代码为中心的方法依赖于可编程机器人API,而这些API在固定接口环境中可能无法使用。SHAPER,是一个用于无

2026-08-23 16:49:04 401

原创 迈向具身智能体的驾驭

26年8月来自宁波东方理工大学的论文“Towards the Harness of Embodied Agents”。编码智能体的成功确立了“驾驭”作为一种范式的地位:智能体的成就不仅取决于模型本身,还取决于其周围的基础设施。其提出这样一个问题:同样的范式是否也适用于物理世界中的具身智体?Thea,一个驾驭,其中智体循环协调机器人的各项能力,每项能力都被封装成一个可调用的工具。它继承了编码智体的核心组件,并根据物理世界的需要进行了修改。然而,现实世界却无法提供软件所拥有的两项能力:读取世界状态和判断动作

2026-08-23 15:23:07 405

原创 具身智能体驾驭综述:从大模型到物理安全控制

在过去的十年中,人工智能已经从被动模式识别转变为主动数字代理推理。大型语言模型 (LLM) 和视 觉-语言模型 (VLM) 的出现催生了一波基础模型浪潮,这些模型展示了深刻的常识推理、复杂的工具 使用和⻓期序列规划。随后,视觉-语言-动作(VLA)模型和空间世界模型(WM)尝试将这些推理能 力直接投射到机器人技术中,将高级指令和视觉输入直接映射到低级末端执行器轨迹或关节扭矩命令 中。然而,将生成模型范例直接部署到物理机器人硬件上会暴露出基本的领域不匹配。

2026-08-19 10:25:37 333

原创 长时程智体的综述:基础、演化、驾驭、优化、应用和前沿(上)

26年7月来自人大、北大、清华、中山大学、港科大和新加坡国立的论文“Towards Long-Horizon Agents: A Survey, Foundation, Evolution, Harness, Optimization, Application, and Frontier”。随着LLM能力的快速发展,人们对人工智能智体的期望正从解决简单的单回合任务转向在现实世界中执行长时程任务。这类系统称为长时程智体:它们能够进行长时程规划,与现实世界环境互动,从自身错误中恢复,并在执行过程中调整策略。

2026-08-10 00:15:00 856

原创 长时程智体的综述:基础、演化、驾驭、优化、应用和前沿(下)

26年7月来自人大、北大、清华、中山大学、港科大和新加坡国立的论文“Towards Long-Horizon Agents: A Survey, Foundation, Evolution, Harness, Optimization, Application, and Frontier”。随着LLM能力的快速发展,人们对人工智能智体的期望正从解决简单的单回合任务转向在现实世界中执行长时程任务。这类系统称为长时程智体:它们能够进行长时程规划,与现实世界环境互动,从自身错误中恢复,并在执行过程中调整策略。这

2026-08-10 00:15:00 277

原创 自演化智体概览:在通往超级人工智能的道路上,应该演化什么、何时演化、如何演化以及在哪里演

25年7月-26年1月来自普林斯顿、清华、CMU、悉尼、上海交大、宾州州立、密歇根、俄勒冈州立、港中文大学、复旦、港科技大学(广州)、港大、UCSB、UCSD、爱丁堡大学和UIUC的论文“A Survey of Self-Evolving Agents:What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence”。大语言模型(LLM)在各种任务中展现了卓越的能力,但其本质上仍然是静态的,无法根据新的任务

2026-08-09 00:15:00 524

原创 现代智体系统中的自我改进:一项综述

26年7月来自吉林大学、韩国 KAUST、Alberta大学和瑞士AI实验室的论文“Self-Improvements in Modern Agentic Systems: A Survey”。自改进型自主智体正从研究原型走向部署系统。其主要目标是在极少甚至无需人工干预的情况下,从经验中实现可控演化或适应。本文将现代自改进型智体定义为能够将经验转化为能力提升的自适应系统。本文提供一个系统级框架,该框架将现代智体表示为一个配置,该配置将基础模型与包含提示、记忆、工具和控制逻辑的操作框架耦合在一起。在该框架下

2026-08-09 00:15:00 344

原创 人工智能医疗健康机器人研究综述与分析

融合人工智能(AI)的医疗健康机器人已成为现代精准医疗的核心基础设施,覆盖外科手术介入、精准放射治疗、康复辅具、院内护理物流、老年长期照护全场景。本文对主流商用机器人平台与学术原型系统进行标准化分类梳理,分析美敦力、强生医疗、安科锐、Caresyntax 等头部企业代表平台的技术架构、临床流程与性能边界。基于 2018—2026 年18 篇同行评议综述与行业白皮书,将医疗机器人划分为五大标准化品类:手术机器人系统、智能放疗机器人、康复辅具机器人、院内物流陪护机器人、外科智能数据平台;并针对大语言模型(LLM

2026-08-08 09:15:42 456

原创 WAM-Nav:用于统一视觉导航的非对称潜世界动作建模

26年6月来自南大、中科院自动化所、中科院大学、中科第五记(FiveAges)、国防大学和极佳科技(GigaAI)的论文“WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation”。视觉导航需要在复杂的几何和物理约束下生成平滑且无碰撞的轨迹。现有的直接将观测结果映射到动作的反应式策略缺乏预测推理能力,限制了其主动避障的能力。虽然视觉想象能够提供预测性预判,但传统的模块化方法将场景预测与策略学习分离,这往往会

2026-08-08 00:15:00 106

原创 MV-WAM:值增强的流形-觉察世界行动模型

26年6月来自北大和北京人形机器人创新中心的论文“MV-WAM: Manifold-Aware World Action Model with Value Augmentation“。在具身机器人领域,实现跨多种环境的稳健且可泛化的操作仍然是一项根本性的挑战。近期的世界动作模型在领域内取得了优异的性能,但其优势并未成比例地扩展到分布外场景。这是由于视觉和动作模态之间存在结构性不匹配,二者固有的异质流形导致联合优化在分布偏移下不成比例地降低了动作的鲁棒性。为了解决这个问题,提出了MV-WAM,这是一个端到端

2026-08-08 00:15:00 486

原创 人工智能在医学领域的综述与分析

随着人工智能技术的快速迭代,大语言模型(LLM)、多模态基础模型以及基于大语言模型的智能Agent,已经成为现代医疗健康体系数字化、智能化转型的核心驱动力。不同于传统依赖任务小规模数据集的机器学习与深度学习方法,当代医学人工智能以基础模型为主导,具备强大的通用理解、跨模态推理与自主决策能力,广泛应用于电子病历分析、医学影像诊断、临床决策支持、药物研发以及个性化医疗等场景。本文基于2023‑2026年17篇国内外最新综述文献,系统梳理面向医学领域的大语言模型、多模态模型、单/多智能Agent的基础概念、核心技

2026-08-07 13:26:09 388

原创 LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型

26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新(Striding AI)公司和无问芯穹(Infinigence AI)公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。视觉-语言-动作模型(VLAs)利用大规模的视觉-语言预训练来实现语义机器人控制,但通常缺乏对机器人动作如何改变场景的明确前瞻性。世界-动作模型(WAMs)通过将策略建立在预测未来的基础上来解决这一

2026-08-07 00:15:00 371

原创 AHA-WAM:观察引导上下文路由的异步范围-自适应的世界-动作建模

26年6月来自上海交大、上海AI实验室、百度AI和港大的论文“AHA-WAM: Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing”。世界动作模型已成为机器人操作的一个有前景的范式,它将视觉场景动态和动作联合建模,以将物理先验注入策略学习中。然而,现有的世界动作模型在相同的时间分辨率下耦合世界预测和动作执行,迫使世界分支去建模那些冗余且信息量弱的近期帧变化。将世界预测和动作执

2026-08-07 00:15:00 322

原创 Riemann-1.0:面向物理AI 的具身世界动作模型

26年7月来自黎曼动力的技术论文“Riemann-1.0: An Embodied World Action Model for Physical AI”。物理人工智能(Physical AI)正推动人工智能从单纯理解数字世界,向感知、推理并作用于物理世界演进。世界动作模型(World Action Models, WAMs)已成为联合建模机器人动作与世界动态的有效范式。然而,现有方法难以有效利用异构具身经验(包括以人为中心的视角视频、手持夹爪演示如 UMI,以及异构机器人轨迹),且缺乏用于联合建模机器人

2026-08-06 01:30:00 417

原创 MemoryWAM:基于持久记忆的高效世界动作建模

26年6月来自港中文大学、清华和浙大的论文“MemoryWAM: Efficient World Action Modeling with Persistent Memory”。在现实世界中实现稳健的机器人操作,不仅需要理解当前的观测信息,还需要具备记忆能力和对环境动态的建模能力。世界动作模型(World Action Models, WAMs)通过结合当前及历史观测信息来联合建模视觉预测与动作,从而具备上述能力,成为机器人操作领域极具前景的范式。然而,现有的 WAM 面临着一个根本性的权衡难题:推理高效

2026-08-06 00:15:00 484

原创 RoboHarness:面向长时程规划异构机器人策略的记忆-驱动编排

26年7月来自华为诺亚、UBC、Toronto大学、Mcgill大学和2012实验室基础模型部的论文“RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning”。长时程机器人任务需要多种能力,而单一策略往往无法可靠地提供所有这些能力。异构策略各具优势且互补,但要协调这些策略,必须应对不确定的能力边界及跨策略分布不匹配等挑战——现有的基于同构、预定义且适用范围固定的技

2026-08-05 00:15:00 1005

原创 SPINE:利用智体人工智能弥合信息物理鸿沟

摘要: 美国西北大学提出SPINE框架,旨在解决具身智能(Embodied AI)在物理机器人部署中面临的调试瓶颈。传统方法依赖专家手动校准硬件、驱动和中间件集成,耗时且易出错。SPINE通过智体(agentic)技术构建两个协同工作流:配置构建器(自动整合机器人文档与硬件信息)和运行时调试器(循环执行诊断-修复-验证)。实验显示,在DOBOT X-Trainer平台上,非专业人员使用SPINE将部署成功率从75%提升至100%,平均调试时间缩短18%;在AgileX PiPER机器人上,SPINE成功解决

2026-08-05 00:15:00 439

原创 EgoSteer:一种基于第一人称视角视频、实现可控灵巧操作的全栈系统

26年7月来自北大、灵初智能和UPenn的论文“EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos”。

2026-08-04 13:43:27 501

原创 WALA:从带动作标签的演示和无动作视频中学习可执行

26年7月来自中科院自动化所、无界动力、中科院大学、新加坡国立和西交利物浦大学的论文“WALA:Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos”。具有泛化能力的机器人策略通常依赖于带有动作标注的机器人演示数据,但此类数据收集成本高昂且难以规模化。相比之下,大规模且易于获取的人类视频记录了丰富的物理交互过程,却缺乏可直接用于机器人控制的动作标注。为此,提出 WALA 框架

2026-08-04 00:15:00 341

原创 BRIDGE-WA:机器人行动中预测世界变化位置与方式

26年7月来自中山大学、鹏程实验室、中科院深圳研究院和拓元智慧公司的论文“BRIDGE-WA: Predicting Where and How the World Changes for Robotic Action”。通用视觉-语言-动作(VLA)模型受益于大规模视觉-语言先验知识,但有效的操作还需要预判与动作相关的场景变化。现有的世界-动作模型往往依赖于大型生成式世界模型或密集的未来状态推演,这些方法不仅计算成本高昂,而且将模型容量浪费在与控制关联度较低的视觉细节上。BRIDGE-WA,是一个轻量级

2026-08-04 00:15:00 408

原创 Gemini Robotics 2:安全评估

26年7月来自谷歌Deepmind机器人组的技术论文“Gemini Robotics 2: Safety Evaluations”。靠近人部署人工智能驱动的机器人,需要重新定义协作安全性。尽管传统的物理防护措施(如急停装置、物理屏障以及速度/力限制)依然必不可少,但新一代智体还必须具备稳健的安全保障机制:(1) 拒绝执行违反操作约束的任务;(2) 在发生硬件故障或人员处于不安全近距离等关键事件时,触发干预措施(如保护性停止);(3) 对“视觉-语言-动作”(VLA)模型屏蔽哪些不可行或属于分布外(out-

2026-08-04 00:15:00 424

原创 HumanScale:在具身预训练中自我为中心的人类视频可以优于真实机器人数据

26年6月来自北大、新加坡国立、MIT、UCSB和Nvidia公司的论文“HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining”。具身基础模型有望像大语言模型那样受益于数据规模的扩展,但目前面临着更为严峻的数据瓶颈。由人类远程操作真实机器人产生的轨迹数据,因其具备精确的动作监督和具身对齐特性,一直是预训练的主要数据来源;然而,受限于高昂的采集成本、获取难度以及行为与环境多样性的匮

2026-08-03 00:15:00 909

原创 Hy-Embodied-0.5-VLA:从VLA模型到现实世界机器人学习栈

26年7月来自腾讯实验室的论文“Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack”。过去一年见证了视觉-语言-动作(VLA)模型的迅猛发展,人们的关注点正日益转向下一代具身基础模型。然而,真正通用的机器人不太可能仅凭单一模型就能实现;相反,它必须构建于一套完整的机器人学习栈之上,确保从数据采集到现实世界部署的全流程稳健性。在本报告中,推出 Hy-Embodied-0

2026-08-03 00:15:00 505

原创 Qwen-RobotNav:专为智体导航系统设计的可扩展导航模型

26年6月来自阿里千问团队的论文“Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System”。智体导航系统需要一种基础导航模型,其观测策略能够在推理阶段进行外部重配置;这是因为指令遵循、物体搜索、目标追踪和自动驾驶虽然共享相同的感知-规划主干网络,但对视觉流的处理策略却截然不同。其提出 Qwen-RobotNav,这是一个基于 Qwen3-VL 构建的可扩展导

2026-08-02 00:15:00 722

原创 Xiaomi-Robotics-1:利用超过 10 万小时的真实世界轨迹数据扩展VLA模型

26年6月来自小米机器人的论文“Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories”。Xiaomi-Robotics-1,是一款基础VLA模型,具备以下能力:(1) 能够遵循多样化的语言指令,在未见过的环境中“开箱即用”地执行广泛的移动操作任务;(2) 仅需极少量的微调数据,即可高效适应新下游任务。其提出一种包含预训练和后训练两个阶段的训练方案。在

2026-08-02 00:15:00 318

原创 WAM-TTT:在测试时观察人类动作引导世界-动作模型

26年7月来自北大、银河通用、中科院自动化所和清华的论文“WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time”。引导机器人基础模型(RFM)适应新的任务变体或用户偏好的行为仍是一项挑战,通常需要额外的机器人演示、针对特定任务的微调或长上下文条件设定。 WAM-TTT,是一个利用原始人类视频来引导“世界动作模型”(World Action Models, WAM)的测试时训练(test-time trainin

2026-08-01 00:15:00 457

原创 WorldSample:基于世界建模的闭环真实机器人RL

26年7月来自新加坡南阳理工、清华、中南大学和北邮的论文“WorldSample: Closed-loop Real-robot RL with World Modelling”。强化学习(RL)能够克服模仿学习(IL)在演示数据覆盖范围上的局限性,允许机器人在演示数据所涵盖的状态之外,通过试错交互不断改进。然而,将RL应用于真实机器人仍面临高昂交互成本的制约,因为每一次物理环境下的运行(rollout)不仅代价高昂,而且仅能反映单一的动作-结果路径。为应对这一挑战,WorldSample作为一种面向真实

2026-08-01 00:15:00 718

原创 WorldScape Policy 1.0:基于基础世界模型的通用机器人学习

26年2月来自流形空间公司的论文"WorldScape Policy: Generalizable Robotic Learning via a Foundation World Model"。世界模型为机器人学习提供了一条极具前景的途径,它能够直接在高维视觉空间中进行预测和规划。然而,与在语言空间中进行推理但通常难以应对分布外视觉变化的视觉-语言-动作(VLA)策略不同,将强大的生成式世界模型转化为可执行的策略仍然极具挑战性。WorldScape Policy 1.0,是一种基于世界模型的策略,它将预

2026-07-31 00:15:00 367

原创 EgoRecovery:通过人类的恢复演示获取故障恢复能力

26年7月来自复旦、上海多模态具身智能重点实验室和深朴智能的论文“EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration”。稳健的具身机器人若要在非结构化且充满噪声的现实环境中可靠运行,必须具备从故障中恢复并重试任务的能力。实现这一能力需要利用包含恢复行​​为的数据来训练策略。然而,通过机器人遥操作收集此类数据难以扩展,因为诱发各种故障状态、执行纠正动作以及重置环境都非常耗时。故障模式的高度多

2026-07-31 00:15:00 399

原创 ABot-AgentOS:一种具备终身多模态记忆的通用机器人智体操作系统

26年7月来自阿里高德视觉实验室的论文“ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory”。尽管近期的视觉-语言模型(VLM)和视觉-语言-动作模型(VLA)提升了机器人的感知与动作预测能力,但长程具身智体仍需一个通用的运行时层,以支持推理、记忆、工具使用、验证及跨形态执行等功能。提出 ABot-AgentOS,这是一个位于底层控制器之上的通用机器人智体操作系统(Agent OS)。它提供一个具备深思熟虑能力

2026-07-30 00:15:00 536

原创 PhysMani:物理原理驱动的 3D 世界模型用于动态物体操作

26年7月来自香港理工和星尘智能的论文“PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation”。在非结构化三维环境中操控快速且动态移动的目标,对于具身智能(Embodied AI)而言仍是一项挑战。现有的视觉-语言-动作(VLA)模型及世界模型,往往难以准确表征三维几何结构或进行符合物理规律的预测。为此,提出 PhysMani 框架,该框架将基于物理原理的三维高斯世界模型与具备未来感知能力的动作策略模型相结合

2026-07-30 00:15:00 725

原创 RynnBrain 1.0:开放式具身基础模型

26年3月来自阿里达摩院的论文“RynnBrain: Open Embodied Foundation Models”。尽管多模态基础模型取得了飞速进展,但具身智能领域仍缺乏一种统一的、基于物理规律的基础模型,能够将感知、推理和规划整合于现实世界的时空动态之中。推出 RynnBrain,这是一个面向具身智能的开源时空基础模型。RynnBrain 在一个统一框架内强化四大核心能力:全面的自我中心视角理解、多样化的时空定位、基于物理规律的推理以及物理-觉察的规划。RynnBrain 系列包含三种规模的基础模

2026-07-29 00:15:00 524

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除