自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1274)
  • 资源 (2)
  • 收藏
  • 关注

原创 FFmpeg 深度技术剖析:从入门到内核——音视频开发者的终极参考书

适用版本:FFmpeg 7.x(n6.1+ 系列)技术深度:★★★★★(源码级分析,含 H.264 解码器、x264 编码器适配器、滤镜系统、多线程模型等核心模块的深度拆解)FFmpeg 是什么?这个问题听起来简单,但要真正回答清楚,需要从多个维度来理解。最简洁的定义:但这句话远不足以概括 FFmpeg 的真正分量。从工程视角看,FFmpeg 是:从学术视角看,FFmpeg 是:从商业视角看,FFmpeg 是:“FFmpeg” 这个名字本身就有故事:所以 “FFmpeg” 可以理解为"快进到 MPEG 的

2026-06-24 21:09:27 570

原创 H264、H265、H266、AV1编码标准技术全面总结

H264、H265、H266、AV1编码标准技术全面总结

2024-11-23 16:03:32 4740 1

原创 Windows11搭建GPU版本PyTorch 开发环境教程

Windows11搭建GPU版本PyTorch环境详细过程

2024-01-28 00:43:17 3218 2

原创 ResARC 深度解析:给自回归图像编解码器补上“两个残差“,超低码率再下一个台阶

图 1(论文 Figure 1):0.022 bpp 下 ResARC 与 StableCodec/DiffC/ARPC/ResULIC 的对比——河豚的斑点纹理、潜水员眼睛的轮廓,ResARC 都明显更接近原图。做视频编码的人都懂:码率一压到极限,失真优化路线(Ballé 系的超先验/自回归熵模型)就开始"抹墙"——纹理糊成塑料,因为 RD 优化在像素域 MSE 上算出来的最优解就是模糊。生成式压缩用生成先验"脑补"细节,把主观质量救了回来:第一代用 GAN(HiFiC 一系),第二代用扩散模型(PerC

2026-10-01 20:25:40 114

原创 ChronoGraph 深度解析:当 4D 场景图遇上 VLM,机器人终于知道“该拧哪个旋钮“

设想一个具身任务:从抽屉里取出锅铲放到灶台上。看懂过去:刚才那个动作干了什么?拉了抽屉把手 → 抽屉从"关"变"开",内部物品暴露出来了;定住现在:当前状态下,哪里可以交互?抽屉把手的三维中心点在哪;预测未来:为了"把锅放到灶上加热"这个目标,下一步该干什么?拧哪个旋钮?拧完之后世界会变成什么样?这三件事在现有评测体系里是割裂的。3D/空间推理基准(SpatialVLM、SpatialRGPT 一系)只考空间关系;4D 基准(VLM4D、DSR、MLLM-4D 一系)只考"观察到的物体怎么动";

2026-10-01 15:17:12 323

原创 VALVE:给 Agent 自我进化装一道“验收闸门“——从 1000 任务长跑到 75% 回撤削减

权重冻结的 LLM Agent,能不能在长程部署中通过积累文本经验持续变强,而不是越跑越废?这个方向叫 in-context self-evolution(上下文内自我进化):模型参数一个不动,Agent 解完任务后把可复用的经验蒸馏成技能(skill)和原则(principle),存进一个持久化的技能库(skill bank),下次遇到新任务时检索相关条目注入上下文。听起来很美——不用训练、不用改 harness,纯文本层面"越用越聪明"。现有方法几乎都是在短视距、有界优化设定下评测的。

2026-09-30 17:13:05 15

原创 InfraVLA 深度解析:让机器人“偷看“监控摄像头导航,为什么光加编码器没用?

先说一个特别生活化的事实:你现在走进任何一个仓库、医院、写字楼、火车站,头顶上都挂着一堆摄像头。这些摄像头 7×24 小时看着整个建筑,实时、高清、还免费——毕竟早就装好了。而你派进去干活的机器人呢?它只看自己鼻子底下那一亩三分地。让它"走到那个箱子那儿去",箱子不在它视野里,它就只能一条过道一条过道地搜,搜到一半发现过道尽头被叉车堵死了,还得原路退回来。而头顶的摄像头把箱子在哪、哪条过道堵了看得一清二楚。这就像什么?

2026-09-30 16:01:22 318

原创 拆开 NVIDIA 的黑盒:UHQ 模式四年憋出来的编码效率,代价竟然是它

上个月我拆过 Katto 实验室的 SFE 论文(把一帧切两半给两颗 NVENC 并行编码),当时留了个悬念:SFE 的实验里有个叫的 tuning 模式表现诡异——开 SFE 不升反降,论文只能说"NVENC 内部配置是黑盒,机制不明"。这篇就是解药的续集。同一批作者这次直接把Pascal(GTX 10 系)到 Blackwell(RTX 50 系)四代 NVENC 纵向拉出来遛了一遍。

2026-09-29 20:17:13 135

原创 别再迷信 QoS 了:ns-3 + FFmpeg 直测 H.264 实时流的 QoE 实践

先说个做流媒体的同学大概都经历过的场面:网络侧监控面板一片绿——延迟 40ms、抖动 3ms、吞吐跑满 300kbps,丢包率 0.5%,一切指标"优秀"。然后切到播放器一看:画面糊成马赛克,动作一顿一顿,还有人脸上一秒三张鬼影。这就是 QoS 与 QoE 的经典背离:网络层指标健康,不代表用户看到的画面好看。原因不难理解——H.264 是重时间预测的编码,一个 I 帧的丢包或错误会沿着 P 帧链传播好几个 GOP(错误扩散),网络层只丢了一个 UDP 包,应用层可能烂了 30 帧画面。

2026-09-29 16:36:00 379

原创 NVIDIA SFE(Split-Frame Encoding)深度拆解:一块 GPU 里塞两个编码器,代价到底有多大?

前段时间有个朋友问我:"4 个 720p 的 H.264 码流能不能拼成一个 2K 码流?"当时我的答案是:码流级拼不了,要么转码拼画面,要么渲染端拼显示。然后我读到了这篇论文,发现自己漏了一个重要的"正主"——NVIDIA 的 Split-Frame Encoding(SFE)。把一帧 8K/4K 画面切成两半,交给 GPU 里两颗独立的 NVENC 硬件编码器芯片并行编码,再把两段码流缝合回一个正常的码流。这不就是"切帧 + 并行编码 + 拼接"吗?只不过它是在。

2026-09-28 20:59:44 137

原创 NVENC UHQ 论文深度解析:NVIDIA 把 B 帧堆到 7 层,换来了 22.79% 的码率,代价是什么?

硬件编码器圈子里流传着一个老段子:NVENC 的画质是"能看",x265 的画质是"能看哭对手"。但 2024 年以来风向变了——Ada Lovelace 和 Blackwell 两代显卡引入了一个神秘的UHQ(Ultra High Quality)调优模式,NVIDIA 官方宣称相比标准 HQ 配置能带来最高 15% 的 BD-Rate 改善,甚至开始能和软编过招。第一层:纵向。

2026-09-28 19:33:00 17

原创 ELLMPEG 论文深度解析:把 FFmpeg 命令生成塞进边缘设备的 Agentic LLM

先说结论:这篇论文干的事情一句话就能讲清楚——让一个能跑在你办公电脑 CPU 上的 7B 小模型,本地听懂"帮我把视频旋转 90 度"这种人话,然后吐出一条正确的 FFmpeg 或 VVenC 命令,全程不联网、不花一分钱 API 费。听起来像 LLMPEG(2024 年那个用 GPT-4o 把自然语言翻译成 FFmpeg 命令的开源项目)的翻版?网络依赖:断网或弱网环境下直接歇菜。对流媒体机房、内网后期流水线、隐私敏感的广电环境,这是硬伤不是瑕疵;API 费用。

2026-09-27 21:20:20 147

原创 当环路滤波遇上深度学习:一篇 IEEE TCE 综述的全景精读

先说清楚这篇论文是什么、不是什么。它不是提出新方法的文章,而是一篇覆盖 2016–2025 年约113 篇DLF(Deep Learning-based Filtering,深度学习滤波)工作的系统综述——从 Dong et al. 2015 年那篇把 SRCNN 搬进压缩伪影去除的开山之作,一路数到 2025 年 JVET NNVC 里的 CCLOP、SCM block。它的独特之处也不在"全",而在视角:以往综述(比如 [74]、[121] 相关工作)几乎都只盯着 RD 性能,这篇的副标题里写着。

2026-09-27 14:43:35 112

原创 ConsistWorld 论文深度解析:多智能体世界模型里的“证据路由“,和你编码器里的参考帧管理是同一件事

自回归视频世界模型(Diffusion Forcing、Self Forcing、LingBot-World 这一脉)这两年已经把"给一张初始图 + 一串控制信号 → 流式生成一个连贯的视觉体验"做得有模有样。只有一个观察者。一旦你把"游戏服务器"的梦想升级成"多个玩家同时在一个世界里跑",问题立刻变质。独立控制的多个观察者,必须把同一个场景画得相互一致——哪怕他们从不同视角、在不同时间撞见同一块区域。自我回访(Self-Revisit)

2026-09-25 21:38:25 115

原创 ϕ-RIE 论文深度解析:从“拍照级重建“到“机器人可以动手“的最后一公里

这两年做视频编码和成像的人多多少少都摸过 3D Gaussian Splatting(3DGS):几百万个带位置、协方差、不透明度和球谐系数的各向异性高斯椭球,把一段多视角采集的画面拟合成一个可以实时渲染的辐射场。渲染层面它已经接近完美了—— ScanNet++ 上的源高斯重建 PSNR 可以做到 21.58 dB,肉眼看几乎就是照片。一个渲染得再真实的 3DGS 场景,机器人也拿不起里面的一只杯子。为什么?论文用"机器人拿起桌上的杯子"这个例子拆解得很透彻。分离(Separation)

2026-09-25 20:33:55 196

原创 Video-HopChain:用「多跳求和题」逼视频模型真正去看视频,再用「置信门控探索」救活 GRPO 的废rollout

RLVR(用可验证奖励做强化学习)已经成了推理模型的标准配方:数学和代码先吃螃蟹,图像跟进,视频自然排下一班。大量工作(Video-R1、VideoChat-R1、Video-Thinker……)都在用 GRPO 对着"可验证答案"训视频模型。视频模型经常根本不看视频就作答(Zhang et al. 2026b、Krojer et al. 2025 的 shortcut-aware 基准都在测这个);更扎心的是,模型可能编码了它看到的东西,却仍然靠先验作答。

2026-09-24 21:39:52 50

原创 LLaVA-Assessor:把「看画质」这件事,做成一个基座大模型

你的编码器把码率压下去了,画质到底掉了多少?PSNR 算得快,但人眼不买账;SSIM 好一点,遇到时域抖动、卡顿依然抓瞎。于是有了 VMAF 这类融合模型,有了 MOS 主观打分,也有了一大堆 DNN 时代的 NR-VQA 模型(FAST-VQA、Dover、KVQ、Modular-VQA……)。它们是"哑巴专家"。你问它"这段视频质量多少分",它能吐一个 0.87;你问它"为什么是 0.87",它什么都说不出来。

2026-09-24 17:22:54 881

原创 AV2 评估方法学深度解析:AOMedia 如何科学地“验货“ AV2?——CTC、凸包与 BD-rate 全拆解

AV2 是 Alliance for Open Media(AOMedia)正在开发的 AV1 后继标准。目标很明确:等效视觉质量下码率显著低于 AV1,支撑 UHD-2(8K)流媒体、VR/AR 这类带宽饥渴型应用,同时给复杂度画了硬杠杠——编码器不超过 AV1 的 5 倍、解码器不超过 2 倍(production-ready 实现口径),并延续开源参考实现的传统。但写编解码器的人都知道,一篇 codec 性能论文最值钱的部分往往不是"省了百分之几十",而是这套数字是怎么量出来的。

2026-09-23 21:40:27 339

原创 BiRoAD 论文深度解析:把 Mid/Side 立体声编码的思想搬进双臂机器人

双臂操作(bimanual manipulation)是机器人学习里出了名的硬骨头。两只 Franka 机械臂要协同完成"递花束"“开冰箱放瓶子”“扫土进簸箕"这类任务,难点不在于单臂抓取本身,而在于角色分配:同样是"把香蕉放进抽屉”,抽屉在左边时通常右臂去开抽屉、左臂拿香蕉;抽屉在右边时角色整个反转。哪个臂当"主角"(操作)、哪个臂当"配角"(辅助),完全由场景决定,而语言指令只说"把香蕉放进顶层抽屉",一个字都不提谁干什么。这带来一个数据层面的深层矛盾。人类遥操作采集的演示数据,天然存在。

2026-09-23 21:17:14 272

原创 600 美元的灵巧手遥操作全家桶——GEX 论文深度解析

上一篇我们拆了 MocapRobot(arXiv 2501.04169):用学习式重定向弥合人手→机器手的具身鸿沟,它依赖的真机平台是 xArm6 +——官方零售价16,000 美元起步。灵巧手太贵,遥操作数据采不起,具身智能就成了少数实验室的玩具。平台价格量级特点六位数($100k+)腱绳驱动,拟人,维护噩梦$16,000+直驱,学术圈事实标准LEAP Hand~$2,000直驱 16-DoF,低成本标杆<$600 / 台,<4h 组装直驱 23-DoF 全家桶。

2026-09-21 22:01:14 174

原创 人手技能如何“搬家“给机器手?——MocapRobot 论文深度解析

先说人话版:这篇论文要解决的问题是——你对着摄像头抓一瓶水、翻一本书,机器人手就能照着做。中间不需要你戴上 VR 头显远程操控机器人,也不需要遥操作手套,更不需要你懂任何机器人学。这事儿为什么难?关键词叫具身鸿沟(Embodiment Gap)。人手之于机器手,就像 H.264 的宏块之于 AV1 的 128×128 超级块。编码工具的"语义"相似(都在分块、预测、变换),但参数空间、边界条件、可施加的"力"完全不同。

2026-09-21 15:24:27 458

原创 PerAct2 论文深度解析:双臂操作的“基准“难题——为什么两个独立智能体学不会配合?

2023 年以来,双臂机器人系统肉眼可见地火了起来:波士顿动力 Atlas、特斯拉 Optimus、Figure 人形,以及学术界的 ALOHA 系列。真机系统很多,系统性研究双臂能力的"考场"几乎没有。看看现有的操作基准(Table 1):robosuite 3 个双臂任务、ManiSkill2 只有 2 个、Orbit 1 个,RLBench 虽有 100+ 任务且自带自动路点数据生成(不用人工采演示)这个杀手锏,但双臂任务为零。

2026-09-20 21:45:22 160

原创 CooHOI 论文深度解析:让两个人形机器人学会“搭把手“——物体动力学作为隐式通信的两阶段协作框架

设想一下搬家场景:床、沙发、衣柜——这些大件家具,一个机器人搬不动,必须两个甚至多个人形机器人协同搬运。这个画面在人类世界稀松平常,在机器人学里却是一道坎。数据缺失:多个人形机器人协作的动捕数据几乎不存在。单人的"走路、搬箱子"数据 AMASS 里一抓一大把,但"两个人合力抬一张长沙发"的全身运动捕捉?成本高到没人做。多智能体训练低效。

2026-09-20 11:45:35 168

原创 IACE 深度解析:双臂机器人该怎么“分工“?AIST 用 14 组真机实验给出架构选型指南

双臂操作是机器人操作领域的硬骨头,也是这个系列博客的老朋友了——ALOHA、BRS、iDP3 里都绕不开它。双臂策略网络的架构本身该怎么设计?数据异构性:把两个 6-DoF 单臂(ViperX、UR5)或 7-DoF 臂(Franka)拼成 12/14-DoF 双臂,硬件构型一变,模型就得微调甚至重训——拼维度的做法对硬件差异零鲁棒性;单臂能力被稀释:双臂任务里左右手角色往往不同——“右手抓起物体、左手接住”(hand-over)本质上是两个单臂技能的接力。

2026-09-19 21:29:37 440

原创 LINGO 深度解析:一句“坐到沙发上喝苹果汁“,让数字人自己走过去、坐下、开喝

行走(locomotion):从 A 走到 B,还得绕开桌椅;伸手(reaching):手够到物体,不穿模;人-物交互(HOI):坐下、躺下、拿起、放下——物体状态随之改变。各管一段:行走、够物、交互通常由专门系统分别建模,拼起来的长序列缺乏连贯性,语义对不上;输入太重:很多工作要用户喂物体轨迹人体关键点动作相位标签甚至预定义路径点——用户得当导演逐帧指挥,违背"说一句话就行"的初衷;数据缺口。

2026-09-19 14:09:33 213

原创 BRS 深度解析:斯坦福全家桶让轮式机器人承包家务,JoyCon 手柄立大功

这篇论文的起点很有意思:作者没有先造机器人,而是先做数据考古。双臂协调(Bimanual):搬大件、抱重物绕不开两只手;稳定精确的导航(Navigation):取个东西经常要跨越半个屋子;广域末端可达性(Reachability):作者统计了家庭任务相关物体的高度分布(Figure 2),发现物体高度呈多峰分布——0.09 m(地上)、0.49 m(低位台面)、0.94 m(桌面)、1.43 m(高处架子)。四个峰横跨从地板到超过成年人舒适举手高度(182.9 cm)的范围。视频编码工程师的类比。

2026-09-18 21:24:45 531

原创 iDP3 深度解析:只用一个场景的数据,人形机器人凭什么能在整个世界干活?

人形机器人autonomous操作是机器人学几十年来的圣杯。2024 年硬件层面已经很热闹了——Boston Dynamics 的电动 Atlas、特斯拉 Optimus、Figure 01、宇树 H1,个个都像从科幻片里走出来的。能全身遥操作人形机器人,但学到的操作技能只认训练时那个场景,换个厨房就废;平台不支持移动底座和腰部自由度,工作空间小得可怜;倒是能泛化到新环境,但它靠的是20 个场景的数据堆出来的泛化。论文的 Table I 把这个领域摸了个底朝天:所有已有人形系统里,

2026-09-18 20:07:12 115

原创 沉浸式 XR/AR 实景直播:从采集到光子的全栈技术地图

要可跟踪、要保真、要实时、要省存储,四选三。生产项目目前仍以静态 3DGS 为主,动态多用于数字人这类"主体可控、背景静态"的特定场景——因为数字人场景里静态部分占绝大多数,正好把 4D 的最贵部分省掉了。从"拿到压缩数据"到"光子打到视网膜"。这段预算通常只有 10~20ms,而人脑对"头动了但画面没动"的容忍度极低——这就是所谓motion-to-photon(MTP)延迟问题,超过阈值就会引起晕动症(cybersickness)。最后是显示端自身的指标,这些数字决定了前文所有努力的"终点门槛"。

2026-09-17 17:19:51 168

原创 实时生成式数字人直播:33ms 帧预算下的全链路技术拆解

实时生成式数字人 = 四个降:降维、降步、降幅、降耦。所有技术路线都在这个坐标系里。速度数字必须绑定分辨率与硬件看。12.8ms/帧(256², 4090)和 32 FPS(14B, 多卡)是两个不同世界的东西。直播优化吞吐,对话优化时延。把两者混为一谈会做出"延迟漂亮但一直卡"的系统。稳定性比画质更难。抖动、漂移、误差累积这三个问题,靠 PSNR 测不出来,必须上时域指标与盲测。工程细节决定成败。

2026-09-17 16:59:38 167

原创 WebRTC 直播端到端延迟降到 200–400ms:0-RTT 信令、MiniSDP 压缩与柔性 FEC(RLNC)的标准化落地全拆解

先说新闻背景,免得你以为我在画饼。2026 年 6 月 1 日,中国通信标准化协会(CCSA)发布了通信行业标准YD/T 7060-2026《基于 WebRTC 的超低延时直播协议技术要求》,并于2026 年 9 月 1 日正式实施——也就是说,就在本月。MiniSDP 压缩(信令压进单个 MTU)、0-RTT 信令交互、柔性 FEC(FlexFEC 及 RLNC 类网络编码)。

2026-09-16 18:16:17 155

原创 NNVC 神经视频编码与 AI 辅助编码实战:当编解码器开始“长脑子“

每一代都是"混合编码框架"的精细化——更聪明的划分(QTMT)、更细的预测(AFFINE/SMVD)、更灵活的变换(MTS/LFNST)、更强的环路滤波(ALF/SAO)。收益在递减:HEVC 相对 H.264 省 ~50% 码率,VVC 相对 HEVC 再省 ~50%,但复杂度的增速已经远超压缩收益的增速——VVC 的解码复杂度是 HEVC 的 2~4 倍,编码复杂度更是数倍以上。靠"手工设计工具箱"这条路,边际收益正在快速逼近零。路线 A:神经工具嵌入标准编码器(NNVC)。

2026-09-16 17:58:07 431

原创 AV2 深度拆解:30% 码率红利到底从哪来?

AV2(AOMedia Video 2)是开放媒体联盟于 2026 年正式发布的下一代开源、免版税视频编码标准,是 AV1 的继任者。维度AV2 规格规范版本v1.0.0(2026-05-28 定稿公开,2026-06-09 正式发布公告)参考软件规范获取色度格式4:0:0 / 4:2:0 / 4:2:2 / 4:4:4(按 profile)位深8 / 10 bit(12-bit 专业档已在 VCWG 立项)最高级别压缩效率同质量下较 AV1 约省 30% 码率(客观指标)

2026-09-16 17:11:38 733

原创 当灵巧手遇上“偏科“的强化学习:北大 UniDexFPM 深度拆解

先讲一个生活场景:桌上一瓶喷雾液躺平了。你要用它,得先把它扶起来,转到喷头朝外的角度,手指还得落在扳机上——注意,不是"能抓起来"就行,是必须精确地摆到一个功能位姿(functional grasp pose),然后才能按下一次成功的抓取。功能性预抓取操作传统 pre-grasp:把物体从"抓不到"变成"抓得到"就行。目标粗粒度——比如把被桌子挡住的物体推出来。已经有一堆工作用平行夹爪借桌子、借墙壁实现。本文的任务:物体本身可达,但要把它摆弄到一个精确指定的六自由度位姿 + 十八个手指关节角度。

2026-09-16 10:52:22 78

原创 DexCap 深度解析:给机器人“攒数据“的神器——穿在人身上的动捕系统,如何让灵巧手学会用剪刀

DexCap 是一套穿在人身上的便携式手部动捕系统——电磁场手套捕手指 + SLAM 相机捕手腕 6-DoF + 胸前 LiDAR 相机捕 3D 场景,让人不碰机器人就能在野外采集高质量操作数据;配套的 DexIL 算法通过指尖逆运动学重定向 + 点云扩散策略,让机器人零真机数据学会剪剪刀、开茶罐这类操作,再加一个"人在环残差修正"机制兜底,30 分钟人类数据就能把成功率干到 72%。(2406.14655):显式分层派——LLM 编排 + RL 技能库 + 优化器兜底;GR00T N1。

2026-09-15 22:36:09 367

原创 HYPERmotion 深度解析:当人形机器人学会“自己想招“——LLM 规划 + RL 技能库 + 全身优化的混合行为规划框架

这篇论文给一台半人马造型的四足轮腿人形机器人(38 个自由度)装上了一整套"大脑—小脑—脊髓"分层系统——LLM 负责想(把一句自然语言拆成任务图)、VLM 负责选(单臂还是双臂、轮子还是腿)、强化学习负责练(把每个技能练成肌肉记忆存进动作库)、全身优化负责兜底(保证练出来的动作物理上真能做)——最终让机器人听懂一句"把抽屉打开、拿起电钻、放进盒子、交给那位同学",然后零样本在线规划、真实世界里把它干完。搞视频编码的人对这个分层结构应该有天然的亲切感。你想想 x265 的码控体系:顶层EncGOP。

2026-09-15 20:52:39 438

原创 AI 实战两年:80% 程序员都用错了

先交代一下背景,免得你看完觉得"这人谁啊就来指点我"。我在北京,写代码写了十一年。前六年做后端,后五年转做视频编解码——对,就是那种又硬又冷、面试官都不太愿意问的方向。日常跟 x265、VTM、FFmpeg 打交道,看的是 CABAC 熵编码、RDOQ 率失真优化、ALF 自适应环路滤波这些玩意儿。偶尔也写点 Python 做图像处理,用 Pillow 做美颜链路的验证。2024 年初,我第一次认真用 ChatGPT。那时候我嗤之以鼻:“这不就是个高级点的自动补全吗?”2024 年中,Cursor 出来,我

2026-09-14 15:19:50 523

原创 GAGrasp 深度解析:把“对称性“焊死在网络里,让机械手转着方向也会抓

灵巧抓取(dexterous grasping)是机器人操作里的"珠穆朗玛峰":给定一个物体的点云观测OOO,你要生成一组灵巧手(比如 Shadow Hand,24 个关节)的配置,让它稳稳地把物体握住。这和平行夹爪(parallel-jaw gripper)那种"一夹了之"完全不是一个难度量级——24 个自由度的耦合、多指接触的力学平衡、手掌姿态的六自由度选择,每一步都是坑。物体转个方向,模型就不会抓了。

2026-09-14 11:45:26 423

原创 DexGraspNet 论文深度解析:132 万条灵巧手抓取是怎么“炼“出来的

机器人抓取这个领域,平行二指夹爪(parallel-jaw gripper)已经被研究得明明白白——ACRONYM、GraspNet-1Billion 这些数据集动辄百万级抓取标注,视觉抓取方法(Contact-GraspNet、VGN 等)也已经能在杂乱场景里实时出 6-DoF 抓取位姿。为什么?因为二指夹爪的抓取位姿最多7 个自由度就能完整描述:平移 3 维 + 旋转 3 维 + 指间距 1 维。搜索空间小,问题就好做。

2026-09-13 18:21:25 230

原创 CogRobot 论文深度解析:当视频编码的“老朋友“光流,成了机器人双臂操作的“中间表示“

单臂机器人操作,相当于单声道;双臂操作(bimanual manipulation)是立体声——不是简单多一路,而是两路信号之间还要有相位协调。你想想人拧瓶盖:左手固定瓶身、右手旋转瓶盖,两个末端执行器之间存在动态的力学耦合与角色分工。动作空间爆炸:两个 7-DoF 机械臂 + 两个夹爪,联合动作维度直接翻倍,而且双臂协作天然是多模态的(同样的任务有一堆合法的协作方式),数据覆盖要求极高;数据极度稀缺:互联网上单臂机械臂视频都算稀有,高质量双臂遥操作数据更是凤毛麟角。

2026-09-13 17:26:35 148

原创 SimToolReal 解读:用“物体中心“视角重新定义灵巧工具操作

SimToolReal 为灵巧工具操作领域提供了一个令人耳目一新的视角:与其教机器人"学会用每种工具",不如教它"学会将任何东西送到目标位姿"。这个看似简单的问题重述,实际上触及了机器人学习中一个更深层的问题——通用性究竟应该编码在策略中,还是编码在任务表示中?SimToolReal 的回答是:策略负责通用技能(抓取、重定向、稳定控制),任务表示负责特定意图(目标位姿序列)。这种分工让策略可以专注于底层物理交互的学习,而不被上层任务的语义复杂性所干扰。

2026-09-12 21:58:21 314

【自然语言处理】基于数据高效的可验证奖励强化学习框架:大规模语言模型推理能力优化系统设计

内容概要:本文提出了一种名为DE-Venus的统一框架,用于提升大规模语言模型(LLM)在推理任务中的数据效率型强化学习与可验证奖励(RLVR)。该框架将监督信号视为在训练过程中不断演化的状态,并围绕三个核心模块构建:主动数据选择、弱监督构建和训练时监督优化。通过将方法特定的干预操作解耦于底层分布式训练系统(verl),DE-Venus实现了对多种代表性RLVR方法的支持,包括样本筛选、伪标签生成、奖励重构与噪声标签修正等,同时保持与现有系统的兼容性。实验表明,在仅使用10%标注数据或低至13%相关数据的情况下,模型性能仍可维持甚至超越全量监督基线,并显著减少收敛步数(降低63%-75%),有效降低了标注成本和训练开销。; 适合人群:具备自然语言处理与深度学习背景,从事大模型训练优化、强化学习应用或数据高效学习研究的研发人员及科研学者。; 使用场景及目标:① 在标注资源有限场景下提升LLM推理能力训练效率;② 整合并复用多样化的弱监督与数据选择方法而不重写训练流程;③ 实现工业级业务场景中如信贷评估、医疗共情与内在安全性训练的成本可控优化; 阅读建议:此资源强调系统架构设计与实际部署之间的平衡,建议结合开源代码深入理解其配置驱动机制、跨阶段状态管理以及如何通过标准化接口集成新方法,尤其关注其“最小侵入”理念在复杂RLVR流水线中的工程实践价值。

2026-09-07

【音频信号处理】基于自监督语音模型的歌唱发声模式分类:声学特征迁移学习在嗓音质量识别中的应用研究

内容概要:本文提出了一种名为voice2mode的歌唱发声模式分类方法,利用自监督语音模型(如HuBERT和wav2vec2)提取的嵌入特征对四种歌唱发声模式(气声、中性/模态、流动、压迫)进行分类。该方法从预训练的大型语音模型中逐层提取表示,经全局时间池化后输入轻量级分类器(SVM或XGBoost)进行分类。实验基于公开的女高音持续元音数据集(763条记录),结果显示,基于基础模型的特征显著优于传统谱特征(如梅尔频谱图、MFCC),其中HuBERT早期层的特征表现最佳,准确率高达约95.7%,相比最优传统基线提升12-15%。研究还发现,底层特征因保留更多声学细节,在分类任务中优于专用于语音识别的高层语义特征。; 适合人群:从事语音信号处理、音乐信息检索、人机交互或计算声学研究的研究人员与工程师,具备机器学习与音频处理基础知识者; 使用场景及目标:①探索自监督语音模型在非语音任务(如歌唱分析)中的迁移能力;②提升歌唱教学系统中发声质量自动识别的准确性;③为声音品质分类任务提供高效、可复现的特征提取方案; 阅读建议:此资源强调使用预训练语音模型进行跨域迁移学习,建议读者关注不同网络层级特征的表现差异,并结合代码实现深入理解特征提取与分类流程,同时可在其他歌唱数据集上验证方法泛化性。

2026-08-29

音频处理基于1D可变形注意力的开放世界声音事件检测框架:未知事件识别与增量学习系统设计

内容概要:本文提出了一种面向开放世界的声音事件检测(Open-World Sound Event Detection, OW-SED)新范式,旨在解决传统闭集声音事件检测在动态环境中无法识别未知声学事件的局限性。受计算机视觉领域开放世界学习启发,OW-SED要求模型不仅能识别已知事件,还需发现并逐步学习新出现的未知声音事件。为此,作者设计了基于1D可变形注意力机制的Deformable DETR架构,以增强对时序关键区域的关注能力,并进一步提出名为WOOT的框架,引入特征解耦机制(分离类特定与类无关表示)和两阶段训练策略(结合一对多匹配与多样性损失),从而提升对未知事件的检测能力和表征多样性。实验表明,该方法在URBAN-SED和DESED数据集上优于现有基线,在开放世界场景下表现出显著优势。; 适合人群:具备深度学习与音频信号处理基础,从事语音识别、环境音检测或持续学习方向研究的研发人员及高校研究生。; 使用场景及目标:①应用于智能监控、智慧城市、医疗监测等需要系统持续适应新型声音事件的实际场景;②推动开放世界学习在音频领域的研究发展,为构建具备增量学习能力的鲁棒音频理解系统提供技术路径;③作为相关课题的研究参考与方法基准。; 阅读建议:建议结合Transformer与目标检测基础理论进行深入理解,重点关注可变形注意力在时序建模中的适配性、特征解耦的设计动机以及多样性损失的作用机制,可通过复现实验加深对开放世界评估协议与模型演进过程的理解。

2026-08-28

【多模态欺骗检测】基于差异感知动态融合的视听欺骗检测框架:ReDA网络设计与状态评估

内容概要:本文提出了一种名为ReDA(Receptive-field Detail-preserving and Discrepancy-Aware)的新型网络框架,用于音视频欺骗检测。该框架在视觉流中设计了ReDP模块,通过膨胀步幅卷积与双池化路径结合,扩大感受野的同时保留面部纹理细节;在音频处理方面采用自监督语音模型并引入掩码均值池化以增强抗噪能力。核心创新在于差异感知动态融合模块,将跨模态不一致性作为欺骗行为的显式指标,通过计算模态间的一致性与差异性,动态调整各模态的可靠性权重,并引入基于熵的正则化技术促进双通道均衡贡献。实验表明,ReDA在DOLOS数据集上取得了最先进的性能。; 适合人群:从事多模态学习、计算机视觉或语音信号处理研究的科研人员,以及对欺骗检测、情感识别、多媒体安全等领域感兴趣的技术开发者。; 使用场景及目标:①提升复杂真实场景下的音视频欺骗检测鲁棒性,尤其适用于存在背景噪声、面部遮挡或压缩失真的低质量输入;②为跨模态融合机制的设计提供新思路,推动基于不一致性的多模态建模方法发展;③应用于司法审讯、在线面试、社交媒体内容审核等高风险交互场景中的自动谎言识别系统。; 阅读建议:建议结合文中图示与公式深入理解ReDP模块结构与差异感知融合机制的工作原理,重点关注消融实验部分以评估各组件的有效性,并可复现其在DOLOS数据集上的实验设置以验证性能优势。

2026-08-28

【计算机视觉】基于观察迁移自蒸馏的对抗性OCR感知框架:ArmorOCR在区域感知文本识别中的应用

内容概要:本文提出了一种针对对抗

2026-08-25

【计算机视觉】基于RGB-D数据的视觉语言模型空间理解增强方法:SpatialBot框架与SpatialQA系列数据集构建

内容概要:本文提出SpatialBot,一种基于视觉语言模型(VLM)并融合RGB与深度图像以增强空间理解能力的新型模型。为解决现有VLM在深度感知方面的局限,作者构建了SpatialQA和SpatialQA-E两个数据集,涵盖多层级、跨场景的深度相关问答任务,用于训练模型理解从低级深度估计到高级空间关系推理的任务。同时提出SpatialBench作为综合评测基准,评估模型的空间理解性能。通过引入深度API机制,SpatialBot可精确查询像素或区域的深度值,从而提升对物体距离、遮挡、相对位置等空间关系的判断能力。实验表明,该模型在空间理解任务上显著优于现有方法,并能有效应用于机器人操作等具身智能场景。; 适合人群:从事计算机视觉、多模态人工智能、机器人感知与控制方向的研究人员及工程技术人员,具备深度学习与视觉语言模型基础知识的研究生及以上层次人员。; 使用场景及目标:①提升VLM在具身AI中的空间推理能力,如机器人抓取、导航与避障;②推动基于RGB-D数据的多模态理解研究,支持高精度空间问答、物体计数、相对位置判断等任务;③为后续空间感知模型提供可复现的训练框架、数据集与评测标准。; 阅读建议:此资源不仅提供了模型架构与训练方法的详细说明,还公开了数据集、代码与模型权重,建议读者结合开源资源进行实践验证,在复现实验的基础上进一步探索深度信息融合的新机制。

2026-08-21

【机器人操作】基于多模态大模型的统一机器人脑框架:从抽象指令到具体动作的跨模态任务规划系统研究

内容概要:本文提出了一种名为RoboBrain的统一多模态大语言模型,旨在提升机器人在复杂操作任务中的规划能力。该模型基于LLaVA架构,结合了机器人专用数据与通用多模态数据,通过多阶段训练策略,整合长视频和高分辨率图像,增强了从抽象指令到具体动作的转化能力。研究团队还构建了一个高质量、细粒度的数据集ShareRobot,涵盖任务规划、物体可操作区域(affordance)和末端执行器轨迹标注,支持跨场景、跨实体的多样化机器人操作任务。实验表明,RoboBrain在多个机器人基准测试(如OpenEQA、RoboVQA和ShareRobot)上实现了最先进的性能,尤其在长期任务规划、轨迹预测和可操作性感知方面表现突出。; 适合人群:从事机器人学习、多模态大语言模型研究的科研人员,以及具备深度学习与计算机视觉背景的研究生和工程技术人员。; 使用场景及目标:①用于机器人复杂任务的高层指令分解与子任务规划;②支持基于视觉输入的可操作区域识别与运动轨迹预测;③推动具身智能中多模态模型向真实世界应用落地。; 阅读建议:本文技术细节丰富,建议结合图表与附录深入理解模型架构设计、训练流程及数据标注方法,重点关注多阶段训练策略与数据配比对性能的影响。

2026-08-20

机器人学基于视觉-语言-动作模型的通用人形机器人基础模型:GR00T N1的架构设计与多模态数据训练方法研究

内容概要:本文介绍了GR00T N1,一个面向通用人形机器人的开源基础模型。该模型采用视觉-语言-动作(VLA)架构,结合双系统设计——基于视觉语言模型(VLM)的“系统2”负责环境理解和任务推理,基于扩散变换器(DiT)的“系统1”实时生成流畅的运动控制动作。两个模块端到端联合训练,实现认知与行动的紧密耦合。为解决真实机器人数据稀缺问题,研究团队构建了金字塔式异构数据体系,融合网络文本、人类第一视角视频、物理仿真生成数据以及真实机器人操作轨迹,并创新性地利用潜在动作码本和逆动力学模型为无动作标签的视频数据生成伪动作标签,从而统一多源数据进行训练。实验表明,GR00T N1在多个模拟基准测试中超越现有模仿学习方法,并在傅里叶GR-1人形机器人上成功实现了高效的双手协同操作任务部署。; 适合人群:从事机器人学习、人工智能、计算机视觉与自然语言处理交叉领域的研究人员、工程师及研究生。; 使用场景及目标:① 探索如何构建能够跨不同机器人形态(从机械臂到人形机器人)迁移的通用智能体;② 研究如何有效利用大规模非机器人原生数据(如互联网视频)来提升机器人策略的泛化能力;③ 实现基于自然语言指令的人机交互,完成复杂、开放性的现实世界操作任务。; 阅读建议:此资源提供了完整的模型架构、训练策略、

2026-08-19

【机器人控制】基于结构化动作空间探索的强化学习框架:面向流匹配视觉-语言-动作模型的在线自适应方法

内容概要:本文提出了一种名为StructRL的新框架,用于改进基于流的视觉-语言-动作(VLA)模型在机器人连续操控任务中的在线强化学习(RL)适应能力。现有方法通常在去噪链内部注入噪声进行探索,但这种方式容易导致“结构化噪声稀释”问题,即中间步骤注入的时序平滑或分组缩放的结构化噪声会被后续去噪过程削弱。为解决此问题,StructRL将随机性从去噪链转移至动作空间,采用确定性常微分方程(ODE)解码器,在最终动作上直接注入具有AR(1)时序相关性和动作分组感知尺度的结构化噪声,并通过“最后一步回放”机制实现对流解码器的有效梯度更新。实验表明,该方法在多个模拟操作基准和两个真实世界任务中显著提升了探索效率和分布外(OOD)性能。; 适合人群:具备强化学习、机器人控制或生成模型背景,从事AI与机器人交叉领域研究的研究人员及工程师。; 使用场景及目标:①提升基于流的VLA模型在长视野、分布外任务中的在线适应能力;②实现更高效、稳定的机器人动作探索,特别是在真实环境中利用稀疏奖励进行快速学习;③为结构化探索噪声的设计与训练信号传递提供新范式。; 阅读建议:此论文技术性强,涉及流模型、强化学习与机器人控制的深度融合,建议读者结合公式推导与图示理解其核心机制,重点关注“噪声稀释”现象的实证分析与“动作空间探索”的设计动机,并参考附录伪代码深入掌握实现细节。

2026-08-18

【计算机视觉】基于密集预测的结构化监督:统一图像视频生成与编辑框架设计

内容概要:本文提出一种统一的图像与视频生成与编辑框架,通过引入深度和表面法线预测作为结构化视觉监督信号,提升模型在指令驱动的视觉创作中对局部几何结构和时间一致性的保持能力。框架采用共享的多模态扩散变换器(MMDiT)主干网络,解耦语义意图与空间视觉信息的处理路径,并通过“互惠上下文注意力”(MCA)机制构建时序对齐的源-目标视频对,支持从文本生成、参考生成到精细化编辑等多种任务。结合渐进式训练策略,该方法在一个单一检查点中实现了七类任务的统一处理,在多个基准测试中取得领先表现,尤其在局部编辑和未编辑区域保持方面显著优于现有方法。; 适合人群:从事计算机视觉、生成模型或多媒体内容创作的研究人员与工程技术人员,尤其是关注扩散模型、视频编辑、多任务学习方向的专业人士。; 使用场景及目标:①提升统一生成系统中的结构保持能力,特别是在局部对象增删、属性修改、背景替换等编辑任务中;②研究感知导向的密集预测任务(如深度估计)如何反向促进生成任务的性能;③构建高质量、多样化的时间对齐视频编辑数据集。; 阅读建议:本文技术性强,涉及扩散模型、注意力机制、多模态融合等复杂概念,建议读者结合图示与公式逐步理解框架设计细节,重点关注MCA机制与渐进训练策略的作用,并可通过复现实验深入掌握结构化监督对下游任务的迁移效果。

2026-08-18

【计算机视觉】基于深度学习的动作质量评估十年综述:技术演进、挑战与未来方向在体育、医疗等领域的应用研究

【计算机视觉】基于深度学习的动作质量评估十年综述:技术演进、挑战与未来方向在体育、医疗等领域的应用研究

2026-07-28

视频生成基于Diffusion Transformer的统一视频创作与编辑框架:支持多模态输入与任务组合的全功能视频合成系统设计

内容概要:本文介绍了VACE,一种基于扩散变换器(Diffusion Transformer)的全合一视频生成与编辑框架,旨在统一多种视频任务,包括参考到视频生成、视频到视频编辑以及遮罩视频编辑等。通过设计统一的输入接口——视频条件单元(VCU),并引入概念解耦策略和可插拔的上下文适配器结构,VACE能够灵活处理多样化的视频合成任务,在保持时空一致性的同时实现高质量的生成效果。实验表明,该模型在多个子任务上性能媲美专用模型,并支持复杂任务组合,如长视频重渲染和跨模态创作。此外,研究团队构建了包含480个样本的多任务评测集VACE-Benchmark,用于系统评估模型表现。; 适合人群:从事计算机视觉、多媒体生成或AI内容创作领域的研究人员、工程师及技术开发者,具备深度学习与生成模型基础知识者优先。; 使用场景及目标:①实现单一模型下多种视频生成与编辑任务的集成化处理,降低部署成本;②探索多条件控制下的创意视频制作,如角色迁移、动作驱动、场景扩展等复合应用;③推动统一架构在视频生成领域的发展,为工业级视频自动化生产提供技术支持。; 阅读建议:建议结合论文中的图示与实验部分深入理解VCU的设计逻辑与Context Adapter的工作机制,重点关注消融实验对模型结构选择的支撑依据,并参考补充材料中的超参数设置进行复现实验。

2026-07-14

【视频生成与推理】基于Chain-of-Frame的OPENCoF框架:通过多源监督数据与视觉-文本推理令牌提升视频生成模型的时空逻辑推理能力

内容概要:本文提出OPENCoF框架,旨在通过视频生成提升模型的推理能力,即“帧链推理”(Chain-of-Frame, CoF)。该框架包含两个核心部分:一是构建包含17,312个视频、覆盖11类任务的OPENCoF-17K数据集,通过实例渲染、专家引导、程序化合成和外部视频再利用四种方式提供多样化的时序监督;二是基于Wan2.2-I2V-A14B模型微调得到WAN-CoF,并进一步探索视觉推理令牌(vt)和文本推理令牌(tt)两种机制,以显式建模中间推理状态。实验表明,仅通过数据增强即可显著提升在多个外部推理基准(如MME-CoF、Gen-ViRe等)上的表现,而引入推理令牌后性能进一步提高,且vt和tt在不同任务维度上表现出互补优势。作者还通过注意力分析揭示了两类令牌在深度、去噪步长、空间和时间上的作用模式。最终指出,强大的视频推理需要广泛的时序监督与专门的中间状态组织机制相结合。 适合人群:从事多模态人工智能、视频生成、视觉推理研究的研究人员与工程技术人员,尤其是关注大模型推理能力发展的高校师生及企业研发人员。 使用场景及目标:①研究如何利用大规模、多样化视频数据提升生成模型的逻辑与物理推理能力;②探索在扩散Transformer(DiT)架构中引入显式推理令牌的设计方法及其对时空一致性的影响;③为后续开发具备因果推断与动态规划能力的智能视频系统提供数据、模型与分析基础。 阅读建议:此资源开源了数据集、模型与代码,建议结合项目页面(https://opencof.github.io/)进行复现与扩展实验,重点关注不同推理令牌的配置对各类推理任务的增益差异,并深入分析注意力可视化结果以理解其工作机制。

2026-07-12

【机器人视觉动作模型】基于时序比率的推理时自适应引导方法:视频-动作泛化差距缓解与组合性迁移能力提升研究

内容概要:本文研究了视频-动作模型(VAMs)在微调后丧失生成性视频基础模型所具备的组合泛化能力的问题,称之为“视频-动作泛化鸿沟”(VAG gap)。作者提出一种基于注意力机制的度量指标——时间比(Temporal Ratio, TR),用于衡量动作头对预测未来潜在状态相对于当前帧的依赖程度。研究表明,TR不仅能有效预测模型的组合泛化能力,还随任务阶段动态变化:规划阶段升高,精确操作时降低。基于此,论文提出TR自适应引导方法,在策略依赖未来预测时动态增强语言与计划条件信号,从而在LIBERO基准和真实双臂机器人任务中显著缓解了OOD-ID组合泛化差距。; 适合人群:从事机器人控制、视觉-语言-动作模型研究的科研人员,以及关注基础模型迁移、组合泛化问题的人工智能工程师;具备深度学习与Transformer架构背景的研究者更为适宜。; 使用场景及目标:①诊断并提升视频-动作模型在新对象-目标组合任务中的泛化性能;②实现无需额外训练的推理时干预,增强复杂操作任务中的计划能力与鲁棒性;③为世界模型与动作策略之间的接口设计提供可解释、可监控的新工具。; 阅读建议:此资源强调从机制层面理解模型行为,建议结合代码实现深入分析TR的计算方式及其在不同噪声水平与训练策略下的表现,并在实际机器人任务中验证自适应引导的有效性。

2026-07-10

基于HEVC的CU级别视频隐写技术

【解决问题】 现有的H.265/HEVC视频隐写分析研究主要集中于运动矢量(MV)、帧内预测模式(IPM)或变换系数的统计特征建模,而针对编码结构级别,尤其是编码单元(CU)级别的隐写行为分析仍处于早期阶段。 【提出方法】 从CU块级隐写分析的角度出发,提出了一种基于CU块结构梯度和帧内预测模式映射的H.265/HEVC视频隐写分析方法,构建CU块结构梯度图以描述编码单元分区变化,并结合IPM的块级映射表示来共同建模CU级别隐写嵌入引入的结构扰动。 【实验结果】 实验结果表明,在不同量化参数和分辨率设置下,该方法在多个H.265/HEVC隐写算法中均实现了优越的检测性能,验证了从编码结构角度进行视频隐写分析的可行性和有效性。

2026-06-18

【计算机视觉】基于Transformer的视频恢复模型:多尺度时空注意力与并行修复架构设计(提供源码)

内容概要:本文提出了一种名为视频恢复Transformer(VRT)的新框架,用于视频超分辨率、去模糊和去噪等视频恢复任务。VRT结合了多尺度架构与两种关键模块——时间互自注意力(TMSA)和并行扭曲,实现了并行帧预测和长程时序依赖建模能力。TMSA通过将视频划分为小片段并在其上应用互注意力进行联合运动估计、特征对齐和融合,同时利用自注意力提取特征;并通过层间序列移位促进跨片段交互。此外,引入并行扭曲机制进一步融合邻近帧的信息。实验表明,VRT在九个基准数据集上的性能显著优于现有方法,最大提升达2.16dB。 适合人群:计算机视觉领域的研究人员、深度学习工程师以及从事视频处理技术开发的专业人员。 使用场景及目标:①解决传统滑动窗口或循环结构在视频恢复中存在的计算效率低、难以建模长距离依赖等问题;②实现高质量的视频超分辨率、去模糊和去噪,适用于监控视频增强、老旧影片修复、移动端视频优化等实际应用场景。 阅读建议:建议读者具备Transformer、注意力机制及视频处理基础知识,结合开源代码(GitHub链接提供)深入理解模型设计细节,并通过复现实验掌握其训练与推理流程。

2026-06-19

【机器人视觉】基于HEVC与JPEG混合传输的带宽受限遥测系统:无人机视觉中ROI图像增强的目标识别性能优化

内容概要:本文提出了一种面向带宽受限机器人视觉的混合视觉遥测架构,通过结合低比特率HEVC连续视频流与选择性传输的高细节JPEG静态图像ROI(感兴趣区域),在有限通信预算下提升下游机器感知性能。研究采用双通道传输范式:基础视频流保障场景连续性与运动感知,稀疏ROI静止图像用于关键对象的精细识别与分类优化。实验基于VisDrone和UAVDT两个无人机数据集,在匹配总比特率约束下比较纯视频与混合传输方案,评估不同ROI调度策略对检测连续性和分类置信度增益的影响。研究表明,合理的ROI选择策略可在仅增加约1.5%-3.1%额外比特开销的情况下显著提升语义理解效果,为后续引入JPEG AI等先进编码器奠定方法论基础。; 适合人群:从事机器人视觉、无人机感知、视频压缩或边缘计算领域的科研人员与工程技术人员,具备计算机视觉与通信系统基础知识者; 使用场景及目标:①解决带宽受限环境下远程机器人系统的视觉感知矛盾——即低码率视频难以兼顾运动连续性与局部细节保留;②探索如何通过任务驱动的ROI选择机制实现信息传输效率最优化;③为未来融合JPEG AI等新型编码技术提供可复现的实验框架与评估协议; 阅读建议:此资源聚焦于系统架构设计与传输策略验证,而非单一编码器性能对比,因此应重点关注其问题建模方式、双通道协同机制及ROI调度策略的设计逻辑,并结合附带开源代码进行复现实验以深入理解其语义增益评估方法。

2026-06-19

视频生成基于谱域前向预测校正的运动一致性文本生成视频方法:SpecLoR技术实现高效轨迹纠偏与物理合理性增强提供源码

内容概要:本文提出了一种名为Spectral Lookahead Rectification(SpecLoR)的推理阶段采样方法,用于解决基于流匹配(Flow Matching)的文本到视频生成中因速度估计误差和数值离散化导致的轨迹漂移问题。该方法通过前向预测获取干净潜在状态的频谱,在频域中分离幅度与相位,仅对幅度谱进行校正以匹配自然视频的统计先验(如1/f幂律衰减),从而在不破坏几何细节的前提下纠正轨迹漂移。随后将修正后的状态重新注入当前时间步,恢复常微分方程(ODE)积分。实验表明,SpecLoR能显著提升视频的物理一致性、运动连贯性和视觉质量,同时计算开销极小(仅增加4个NFE)。; 适合人群:从事AI视频生成、深度学习模型优化的研究人员及工程技术人员,尤其适用于熟悉扩散模型、流匹配机制和频域信号处理的专业开发者。; 使用场景及目标:① 在文本到视频生成中抑制因采样漂移引起的结构伪影(如肢体复制、物体漂浮);② 提升复杂动态场景下的运动连贯性与物理合理性;③ 实现即插即用式的推理优化,兼容多种主流T2V架构(如Wan2.2、HunyuanVideo)。; 阅读建议:建议结合论文中的图示(如Fig. 1b和Fig. 3)理解四阶段流程(前向投影、频率解耦、幅度校正、重加噪),重点关注早期高噪声阶段干预的关键窗口及其对全局结构的影响。同时可参考附录中的伪代码实现快速复现,并注意相位保护与幅度校正之间的平衡关系。

2026-06-13

【机器人控制】基于语义视觉-动作分词器的世界模型:RepWAM框架在真实与仿真操作任务中的性能评估提供源码

内容概要:本文提出RepWAM(Representation World Action Model),一种基于语义视觉-动作分词器的表征中心型世界动作模型。该模型通过将视觉潜在空间与冻结的视觉基础模型对齐,构建语义丰富的视觉标记,并在此共享语义空间中学习紧耦合物体级交互的操作中心动作标记,形成统一的语义视觉-动作分词器。在此基础上,RepWAM联合建模语言指令条件下的未来视觉状态及其对应的动作序列,并通过真实机器人轨迹进行闭环控制适配。实验表明,该方法在真实操作任务和仿真基准上均表现出色,验证了语义视觉-动作分词化优于传统重建导向方法的有效性。; 适合人群:从事机器人学习、计算机视觉与多模态AI研究的研究人员及工程技术人员,尤其是关注世界模型、视觉-动作表示学习与具身智能系统开发的专业人士。; 使用场景及目标:①提升具身智能体在复杂环境中的动态建模与指令跟随能力;②实现高质量的闭环比操作控制,在长视野、细粒度任务中增强行为连贯性与执行鲁棒性;③为无需预训练视频生成主干的世界动作模型提供新范式。; 阅读建议:此资源强调表征设计对世界动作模型性能的关键作用,建议读者重点关注视觉-动作分词器的设计原理与两阶段预训练机制,结合消融实验深入理解语义对齐与潜在动作建模带来的增益效果。

2026-06-13

语音翻译基于偏好学习的流式语音到语音翻译优化:减少打断性停顿以实现自然语音流畅度

内容概要:本文提出了一种名为NaturalFlow的流利性感知优化框架,旨在减少同步语音到语音翻译(Simul-S2ST)中的非自然停顿,提升语音输出的自然流畅度。现有模型为追求低延迟常采用分块处理策略,导致翻译语音频繁中断、听感不连贯。NaturalFlow基于Hibiki模型,利用大语言模型的生成灵活性,通过直接偏好优化(DPO)方法训练模型生成语义一致但发音时长更长的表达,从而填补等待源语音输入的时间,避免插入破坏性静音。为平衡翻译质量与语音连续性,研究提出“银牌偏好”(Silver-Medal Preference)数据构建策略,选择次优低静音比例样本作为正例,防止模型过度压缩静音而牺牲语义准确性。实验在多个短时与长时语音翻译基准上验证了该方法能显著降低静音比,同时保持良好的翻译质量和低延迟,并获得人类评估者的明显偏好。; 适合人群:从事语音翻译、自然语言处理或人机交互方向的研究人员及工程技术人员,尤其是关注实时语音交互系统用户体验与模型优化策略的专业人士。; 使用场景及目标:①用于改进同步语音翻译系统的语音输出流畅性,减少听众认知负担;②为偏好学习在多模态生成任务中的应用提供新思路,特别是在需要权衡语义保真与时间连续性的实时生成场景中。; 阅读建议:此资源融合了模型架构、优化目标与人类感知评估,建议读者重点关注“银牌偏好”的设计动机与消融实验分析,理解其如何稳定训练过程并避免优化崩溃,同时结合论文提供的演示链接体验实际语音效果差异。

2026-06-13

【多媒体处理】基于边缘计算的代理式大语言模型框架:面向FFmpeg与VVenC视频编码命令生成的高效本地化系统设计

内容概要:本文提出了一种名为ELLMPEG的边缘计算环境下的智能大语言模型(LLM)视频处理工具,旨在通过结合检索增强生成(RAG)、自反思维机制与开源小规模LLM,在本地高效生成准确的FFmpeg和VVenC视频处理命令。该系统采用多阶段流程,包括查询解析、工具选择、文档检索、命令生成、自我批判与迭代优化,最终输出可执行指令并验证其正确性。为评估性能,研究构建了一个包含480个多样化查询的数据集,并对四种主流开源LLM进行了全面评测。实验结果表明,Qwen2.5在ELLMPEG框架下实现了平均78%的命令生成准确率,显著优于其他模型,同时避免了云API的持续成本和隐私风险。; 适合人群:从事多媒体处理、边缘计算或AI系统开发的研究人员与工程师,以及关注大语言模型实际应用与优化的技术从业者。; 使用场景及目标:① 在无网络连接或带宽受限环境中实现高效的本地化视频编码与转码操作;② 利用轻量级LLM结合RAG与自反思机制提升领域特定任务(如复杂命令生成)的准确性与可靠性;③ 推动低功耗设备上智能化多媒体处理工具的发展,降低对大型云端模型的依赖。; 阅读建议:此论文技术性强,涉及架构设计、算法实现与实证分析,建议读者结合图示与算法伪代码逐步理解系统工作流,并重点关注消融实验部分以掌握各模块对整体性能的贡献度。

2026-09-28

【机器人操作】基于量化手部状态的灵巧操作学习:机械臂-手协同控制策略研究

内容概要:本文提出了一种名为DQ-RISE的新方法,用于解决灵巧机器人手部操作中因高自由度导致的手臂与手部动作空间耦合、学习不平衡的问题。该方法通过对灵巧手的状态进行量化,将其压缩为一组紧凑且具有任务相关性的离散模式,并引入连续松弛机制,使手臂动作能够与量化后的小维度手部状态联合扩散,从而提升臂-手协调性和空间定位精度。同时,作者设计了一套VR-手套混合遥操作系统,便于直观高效地采集演示数据。实验表明,DQ-RISE在多种复杂灵巧操作任务(如开罐、烤面包等)中显著优于现有方法,实现了更均衡、高效的策略学习。; 适合人群:从事机器人控制、模仿学习、灵巧操作研究的科研人员及工程技术人员,尤其是关注视觉-运动策略设计与人机交互接口开发的研究者。; 使用场景及目标:①提升高自由度灵巧手在真实环境下的操作性能;②优化多自由度系统中的动作预测架构,避免手部动作主导联合动作空间;③构建更自然、低认知负荷的单臂灵巧遥操作界面; 阅读建议:建议结合图示与实验部分深入理解量化手态与连续松弛的设计动机,重点关注其在梯度传播一致性、动作协调性方面的优势,并可参考其遥操作硬件配置用于实际系统搭建。

2026-09-25

【计算机视觉】基于感知决策机制的多模态大模型视觉质量评估系统:面向图像与视频的统一质量解释与评分框架设计

内容概要:本文提出了一种名为LLaVA-Assessor的统一数据构建与模型训练系统,旨在通过模仿人类视觉系统的“感知-决策”机制,实现图像与视频质量评估的自动化。该系统将视觉质量评估分解为两个互补任务:“质量解释”和“质量评分”,并设计了适应多模态输入(图像和视频)的模型架构。为了高效构建大规模高质量的多模态指令数据库(MIDB),研究团队采用严谨的人工标注协议,并结合以机器合成为主的数据扩展流程,利用领域专家模型作为标注器、通用大模型作为评判者以及人工参与审核的方式进行数据增强。此外,文章引入一种简单而有效的提示解耦策略,避免多任务联合训练中的目标混淆问题,从而实现稳定且一致的训练过程。最终得到的统一多模态大模型LLaVA-Assessor-GIGA在11个图像/视频质量评分测试集和4个视觉质量解释基准上均表现出优越性能。实验验证了结构化数据构建、自适应模型设计与多任务联合训练相结合的有效性,为发展用于自动视觉质量评估的基础性多模态大模型提供了重要思路。项目页面位于https://github.com/jzhws/LLaVA-Assessor。; 适合人群:从事计算机视觉、多模态人工智能、图像/视频质量评估相关研究的研究人员及工程技术人员,尤其是关注大型多模态模型(LMMs)在低层次视觉任务中应用的学者;具备深度学习、视觉语言模型基础知识的研究生及以上学历人员。; 使用场景及目标:① 构建能够同时处理图像与视频输入的统一视觉质量评估模型;② 实现对视觉信号的质量打分(定量)与质量问题描述(定性)双重能力;③ 探索基于人机协同的大规模指令数据构建方法,解决高质量标注成本高的问题;④ 解决多任务、多模态联合训练中的目标混淆难题,提升模型稳定性与泛化能力。

2026-09-24

【视频编码技术】基于AV2标准的压缩性能评估方法与质量增益分析:面向下一代流媒体应用的标准化测试框架设计

内容概要:本文介绍了Alliance for Open Media(AOMedia)为下一代视频编码标准AV2制定的通用测试条件(AV2 CTC),详细阐述了其质量与性能评估方法,包括测试视频序列的选择、编码配置、自适应流媒体的凸包构建方法以及编码增益的计算方式。AV2相较于AV1在多种配置下实现了显著的压缩效率提升,实验结果显示,在随机访问和自适应流媒体配置中,基于VMAF的比特率节省分别达到33.79%和35.77%,尤其在屏幕内容和HDR内容上表现突出。此外,CTC引入了用户生成内容(UGC)、扩展色度格式和动态分辨率切换等新特性,以更贴近实际应用场景。; 适合人群:从事视频编码、多媒体技术研究或开发的工程师与科研人员,具备视频压缩基础知识及相关行业经验的技术从业者。; 使用场景及目标:①用于评估AV2编码工具的压缩性能与视觉质量;②支持标准化的编码增益比较,推动AV2标准的公平、透明发展;③适用于流媒体、短视频平台、HDR/UGC内容传输等高效压缩需求场景。; 阅读建议:本文技术性强,涉及较多视频编码术语与指标(如BD-rate、VMAF、QP等),建议结合AOMedia发布的CTC文档v8.0及其他参考文献进行深入理解,并关注后续解码复杂度优化进展。

2026-09-24

【机器人学习】基于对称-反对称分解的双臂操作角色自适应表示学习:面向场景条件下的双臂协调控制策略机器人学基于对称-反对称分解的双臂操作角色自适应表示学习:面向场景条件下的双手机械臂协同控制策略优化

内容概要:本文提出了一种名为BiRoAD(Bimanual Role-Adaptive Decomposition)的框架,用于双臂操作中的共享与角色自适应表征学习。该方法通过将双臂轨迹或动作特征分解为交换对称(swap-symmetric)和交换反对称(swap-antisymmetric)两个成分,分别捕捉跨手臂协调结构的一致性以及功能角色差异的变化性。这种分解以残差更新形式集成到现有策略中,无需修改输入输出接口、模仿学习目标或手动定义角色标签。在多种任务和不平衡角色分布下,BiRoAD显著提升了策略在不同角色配置下的泛化能力与鲁棒性,尤其改善了稀有角色组合的表现。实验涵盖仿真环境与真实机器人验证,证明了其有效性。; 适合人群:从事机器人学习、模仿学习或双臂操控研究的科研人员及工程技术人员,具备深度学习与强化学习基础者; 使用场景及目标:①提升双臂协作策略在不均衡示范数据下的泛化能力;②实现无需显式角色标注的功能角色自适应控制;③增强模型对场景变化引起的角色分工调整的适应性; 阅读建议:建议结合论文中的图示与消融实验深入理解对称-反对称分解机制的作用路径,关注其在不同插入位置的效果差异,并可尝试将其模块化思想迁移至其他多智能体协同任务中进行验证与扩展。

2026-09-23

机器人学基于大语言模型与蒙特卡洛树搜索的双臂灵巧操作数据生成框架:面向人形机器人的高精度任务规划与仿真演示收集

内容概要:本文提出了一种名为HumanoidGen的自动化任务创建与示范数据收集框架,用于解决人形机器人双臂灵巧操作中高质量示范数据稀缺的问题。该框架结合原子级灵巧操作定义与大语言模型(LLM)推理,生成具有空间关系约束的任务规划链。通过为资产和灵巧手提供空间标注,利用LLM进行基于物体功能和场景的推理,生成可执行的空间约束代码,并借助轨迹优化器求解得到动作序列。为进一步提升长视野任务和标注不足情况下的规划能力,引入蒙特卡洛树搜索(MCTS)变体增强LLM推理。实验构建了包含20项不同难度任务的HGen-Bench基准,验证了所生成数据的有效性,结果显示扩散策略模型性能随数据量增加而持续提升。; 适合人群:从事机器人学、人工智能、特别是具身智能与灵巧操作研究的研究人员和工程技术人员。; 使用场景及目标:①为双臂灵巧操作任务提供可扩展的自动化示范数据生成方法;②支持复杂长周期任务的自主规划与执行;③构建标准化基准以评估灵巧操作策略的学习效果与泛化能力。; 阅读建议:此资源聚焦于通过LLM驱动的代码生成与MCTS增强推理实现高效数据合成,不仅适用于仿真环境中的策略训练,也为现实世界任务迁移提供了可能路径,建议结合附录中的实现细节与提示模板深入理解系统架构与技术实现。

2026-09-14

【机器人操作】基于点轨迹跟踪的通用灵巧操作策略:面向真实场景的任务无关Sim-to-Real框架设计

内容概要:本文提出Dex4D,一种基于任务无关的模拟到现实灵巧操作框架,通过视频生成与4D重建提取以物体为中心的点轨迹,训练“任意位姿到任意位姿”(Anypose-to-Anypose)的通用策略。该方法在仿真中学习无需任务特定奖励或语言指令的点轨迹条件策略,利用配对点编码(Paired Point Encoding)保留当前与目标点之间的对应关系,提升几何感知与鲁棒性,并结合Transformer架构的动作世界模型实现闭环控制。部署时,仅需从生成视频中提取点轨迹即可零样本迁移至真实世界,适用于多种未见物体、场景布局与任务轨迹。实验表明,该方法在仿真与真实机器人上均显著优于现有基线,具备强泛化能力。; 适合人群:从事机器人学习、计算机视觉与强化学习研究的科研人员,以及关注灵巧操作、sim-to-real迁移、3D表示学习的技术开发者。; 使用场景及目标:① 实现无需真实数据微调的零样本灵巧操作任务执行;② 探索基于点云轨迹的通用目标表示方法;③ 构建融合视频生成规划与低层策略控制的端到端机器人系统;④ 提升高自由度机械手在噪声、遮挡等现实干扰下的鲁棒操控能力。; 阅读建议:建议结合项目网站https://dex4d.github.io中的可视化视频与代码实现,深入理解点轨迹提取、配对编码机制及教师-学生策略蒸馏流程,重点关注其在闭环感知-动作耦合方面的设计创新。

2026-09-14

OpenEgo,一个大规模多模态的自我中心操作数据集,旨在推动灵巧操作的视觉-语言-动作学习

内容概要:本文介绍了OpenEgo,一个大规模多模态的自我中心操作数据集,旨在推动灵巧操作的视觉-语言-动作学习。该数据集整合了六个公开的自我中心视频数据集,总计1107小时、1.196亿帧,涵盖290种操作任务和600多个环境,统一标注了21关节的手部姿态(基于MANO模型)并提供了与意图对齐的细粒度语言动作原语(带时间戳)。作者通过训练语言条件下的模仿学习策略来预测未来3D手部轨迹,验证了数据集的有效性。OpenEgo是目前最大规模的同时具备精细手部标注和语言动作描述的自我中心数据集,支持可复现的机器人操作研究。所有资源将在www.openegocentric.com发布。; 适合人群:计算机视觉、机器人学、人工智能领域的研究人员,尤其是从事模仿学习、视觉-语言-动作建模、人机交互和灵巧操作的研究人员或工程师;具备深度学习和多模态数据处理背景的研究生及以上学者。; 使用场景及目标:①用于训练和评估语言驱动的灵巧手部动作预测模型;②支持视觉-语言-动作(VLA)基础模型的预训练与微调;③促进基于自我中心视频的层次化操作策略学习与跨数据集泛化研究;④降低从第一视角视频中学习复杂操作技能的技术门槛。; 阅读建议:此资源强调数据标准化与跨源整合,使用者应关注不同原始数据集的坐标系转换方法、手部可见性掩码处理以及语言标注的一致性构建过程。建议结合附录中的许可证信息合规使用各子集,并参考实验设置复现轨迹预测基线模型。

2026-09-14

机器人学基于操作类型的灵巧遥操作系统TypeTele:融合多模态大模型的遥操类型检索与插值映射策略

内容概要:本文提出了一种新型灵巧操作遥操作系统TypeTele,通过引入“灵巧操作类型”概念,突破传统基于手势映射的遥操作局限,使机器人手能够执行超越人类手部运动能力的动作。系统构建了一个包含30种操作类型的层级化灵巧操作库,涵盖单手与双手协作任务,并结合多模态大语言模型(MLLM)辅助的任务意图理解,自动检索并匹配最合适的操作类型。在控制层面,采用插值映射策略将人类手势自然映射到目标操作类型,实现直观操控。实验表明,该系统显著提升了复杂任务的成功率与数据采集效率,尤其在剪刀使用、重水壶倾倒等高难度任务中表现突出,同时所收集的数据质量更高,有效提升了模仿学习策略的性能。; 适合人群:机器人学、人机交互、自动化控制及相关领域的研究人员与工程技术人员,尤其是从事遥操作、灵巧手控制与模仿学习的研究者。; 使用场景及目标:①解决传统遥操作中因人形与机器人形态差异导致的动作失配问题;②提升复杂灵巧操作任务的完成能力与效率;③为自主机器人策略训练提供高质量示范数据集;④支持语音指令驱动的智能遥操作应用开发。; 阅读建议:此资源技术性强,涉及机器人控制、大模型融合与系统集成,建议结合图示与补充材料深入理解类型库构建逻辑、MLLM提示设计及硬件控制细节,重点关注其在跨形态动作迁移方面的创新思路。

2026-09-14

【计算机视觉】基于大规模第一人称视频的灵巧操作学习数据集EgoDex构建与基准评测

内容概要:本文介绍了EgoDex,目前最大规模的以第一人称视角(egocentric)记录的人类灵巧操作数据集,包含829小时、9000万帧的高清视频及同步的3D手部与身体姿态标注,覆盖194种桌面级日常操作任务,如系鞋带、折叠衣物、拧瓶盖等。该数据集利用Apple Vision Pro设备采集,具备高精度SLAM与多摄像头标定支持下的实时3D姿态追踪能力,强调行为多样性而非场景多样性。作者还建立了基于该数据集的模仿学习基准,用于手部轨迹预测,并提出“最佳K选”评估指标以应对动作的多模态特性。实验表明模型性能随数据量增加而提升,验证了大规模人类操作数据对机器人控制、视觉理解与世界模型构建的价值。; 适合人群:计算机视觉、机器人学、具身智能、动作识别与生成领域的研究人员及工程技术人员;具备深度学习与多模态数据处理基础的研究生与从业者。; 使用场景及目标:①推动从人类视频中学习灵巧操作的模仿学习方法发展;②为手-物交互建模、动作预测、目标操作理解提供高质量训练与评测基准;③支持面向第一人称视角的世界模型与视频生成研究。; 阅读建议:重点关注数据集的设计理念(被动可扩展性)、标注质量保障机制(多视角SLAM与生产级手部检测)、基准任务设定及评估方式;结合附录中的任务列表与关节定义深入理解数据结构,便于实际应用时进行任务对齐与特征提取。

2026-09-14

机器人学基于运动重定向的灵巧手遥操作系统:20自由度仿人机械手高保真动作复现与协调控制

内容概要:本文提出了一种灵巧的手臂遥操作系统,用于实现对20自由度(DoF)的仿人机器人手ByteDexter的高保真远程操控。系统结合了高自由度连杆驱动机械手与基于优化的人体手势重定向技术,能够在实时控制下精确复现复杂的人手动作,并实现手-臂协调操作。ByteDexter手具有新颖的拇指机构设计、微秒级运动学求解器和紧凑结构,在硬件上支持精细操作。通过使用Manus量子手套和Meta Quest 3头显捕捉人体手部与腕部姿态,系统采用关键向量优化方法进行动作映射,有效缓解了人机形态差异带来的控制难题。实验验证包括多种灵巧操作任务以及长达九个物品的杂乱化妆台整理任务,展示了系统的实用性与高性能。; 适合人群:机器人学、自动化、人工智能及相关领域的研究人员和技术开发者,特别是关注高自由度机器人手控制、遥操作、模仿学习和灵巧操作的研究人员;具备一定机器人学基础的研究生或工程师。; 使用场景及目标:①为高自由度仿人机器人手提供高效、直观的遥操作接口;②生成高质量的人类灵巧操作示范数据,服务于模仿学习与自主技能习得;③推动家庭服务机器人中复杂物体操作能力的发展,如整理物品、开盖、抽屉操作等真实场景任务。; 阅读建议:本文技术细节丰富,涉及机械设计、运动学建模、优化算法与系统集成,建议结合附录中的运动学推导深入理解控制机制;同时推荐观看配套视频以直观了解系统性能表现。

2026-09-14

【机器人操作】基于空间锚定触觉感知的灵巧操作框架:高精度装配任务中的几何推理与控制

内容概要:本文提出了一种名为SaTA(Spatially-anchored Tactile Awareness)的端到端灵巧操作策略框架,旨在解决现有触觉学习方法在亚毫米级高精度操作任务中几何推理能力不足的问题。SaTA的核心创新在于通过正向运动学将触觉特征显式锚定到机械手的运动学坐标系中,在保持触觉信号感知丰富性的同时实现空间定位,从而支持精确的几何推理。该方法无需依赖物体模型或显式的姿态估计,即可从多模态输入(视觉、触觉图像、关节状态)直接生成精细的操作动作。作者在三个高难度任务上进行了验证:双手机构下的USB-C插接、灯泡安装和纸牌滑动,实验结果显示SaTA显著优于多种强基线方法,成功率最高提升30%,完成时间减少27%。消融研究进一步证明了空间锚定机制中各组件(如FiLM调制、傅里叶编码、手部坐标系选择)的关键作用。 适合人群:机器人学、人工智能、自动化及相关领域的研究人员与工程技术人员,特别是关注灵巧操作、多模态感知融合、触觉传感应用和模仿学习的研究者。 使用场景及目标:① 提升机器人在视觉受限场景下的高精度操作能力,如精密装配、医疗手术辅助、家庭服务等;② 推动基于学习的方法在传统依赖模型控制的任务中取得突破;③ 为触觉表示学习提供新的设计范式,促进具有空间感知能力的触觉驱动控制架构发展。 阅读建议:此资源强调触觉信息的空间锚定对几何推理的重要性,不仅提出了新架构,还深入分析了失败模式与触觉感知的三个层次。建议读者结合图示与消融实验部分仔细理解空间锚定的设计动机,并思考如何将其思想迁移至其他多模态机器人学习任务中。

2026-09-14

机器人学基于LiDAR的全景感知操控策略:面向大范围工作空间人形机器人灵巧操作的端到端3D视觉运动控制方法

内容概要:本文提出了一种名为OmniDP的端到端激光雷达驱动的三维视觉运动策略,旨在解决人形机器人在非结构化环境中因感知视野受限而导致的操作空间狭窄问题。OmniDP利用全景点云数据,结合时间感知注意力池化机制(TAP),有效编码稀疏3D数据并捕捉时序依赖关系,实现360°环境感知,使人形机器人能够在大范围工作空间中完成超越视场范围的物体操作任务,同时避免碰撞。为支持策略学习,研究团队还开发了全身遥操作系统,用于高效采集包含复杂全身协调动作的演示数据。通过仿真与真实环境中的大量实验验证,OmniDP在大空间、杂乱场景下的操作任务中表现出优于基于RGB或深度相机基线方法的鲁棒性和泛化能力。; 适合人群:机器人学、人工智能、自动控制及相关领域的研究人员和技术开发者,尤其是关注人形机器人灵巧操作、三维感知与运动策略学习的专业人士;具备一定深度学习和机器人系统基础知识的研究生及以上学者。; 使用场景及目标:①提升人形机器人在物理受限无法移动基座时的大范围操作能力;②实现遮挡严重或目标位于摄像头盲区时的安全、无碰撞双臂协同操作;③推动基于LiDAR的全向三维感知在具身智能体中的应用研究;④为遥操作数据采集与端到端策略训练提供可复现的技术路径。; 阅读建议:建议结合图示(如图1-6)深入理解OmniDP相较于传统视觉方法的优势,重点关注时间感知注意力池化机制的设计动机与实现细节,并参考消融实验(Table IV)评估各模块贡献。对于希望复现实验的研究者,应仔细阅读第三节方法与第四节实验设置部分,特别是点云预处理流程与遥操作硬件配置。

2026-09-10

机器人学基于几何与空间手物表征的灵巧操作学习:DexRepNet++多任务通用抓取与重定向系统设计

内容概要:本文提出了一种名为DexRep的新型手-物交互表示方法,用于提升多指灵巧手在复杂操作任务中的泛化能力。DexRep通过融合几何与空间特征,包括体素化的占据特征、手关键点与物体表面最近点的距离和法向量(表面特征),以及基于预训练PointNet提取的局部几何特征,构建了一个紧凑且结构化的表示框架。该表示方法在抓取、手中重定向和双手交接三项任务中均显著提升了策略的成功率和泛化性能,即使在仅使用40个训练对象的情况下,也能在超过5000个未见物体上实现近88%的抓取成功率,并有效缩小了仿真到现实的差距。实验验证了其在不同观测条件、摩擦系数变化及多种机械手形态下的鲁棒性和适应性。; 适合人群:从事机器人学、深度强化学习、灵巧操作或三维视觉研究的科研人员及工程技术人员,特别是关注机器人感知-动作闭环系统设计的研究者。; 使用场景及目标:①解决高自由度灵巧手在复杂接触下的样本效率与泛化难题;②提升机器人在未知物体上的抓取、精细操控与双手机械协同能力;③推动仿真训练模型向真实世界部署的应用转化; 阅读建议:建议结合文中提供的消融实验与参数敏感性分析,深入理解各模块的作用机制,尤其关注局部几何特征相较于全局形状编码的优势,并可参考其在部分点云输入下的部署策略以增强实际应用中的鲁棒性。

2026-09-10

【机器人学习】基于仿真数据的类人机器人操作框架:OASIS系统在零样本真实场景部署中的应用研究

内容概要:本文提出OASIS,一种完全基于仿真数据驱动的人形机器人运动操作(loco-manipulation)框架。该框架通过从真实物体图像自动生成具有物理属性的3D仿真资产,在虚拟环境中进行VR遥操作收集演示轨迹,并通过离线重渲染与视觉域随机化(如纹理、光照、相机参数)大幅增强数据多样性。基于这些仿真数据,设计了一种分层的视觉运动策略模型,其中高层使用Flow Matching方法预测参考动作序列,底层控制器将指令转化为关节角度执行。实验表明,仅使用仿真数据训练的策略可在真实Unitree G1人形机器人上实现零样本迁移,性能媲美甚至优于基于真实机器人采集的数据。 适合人群:机器人学、计算机视觉与人工智能领域的研究人员,尤其是从事仿真到现实迁移、人形机器人控制、模仿学习和视觉运动策略设计的科研人员与工程技术人员。 使用场景及目标:①解决真实世界人形机器人数据采集效率低、成本高、易损坏设备等问题;②实现高质量仿真数据的大规模生成与有效利用;③推动零样本仿真到现实迁移在复杂全身操控任务中的应用。 阅读建议:重点关注OASIS框架中从真实图像到仿真资产的自动化构建流程、两阶段数据采集机制(实时遥操作+离线高保真渲染)、以及分层策略训练中的课程式 rollout 方法,理解其如何提升sim-to-real迁移效果。同时可结合附录中的参数设置与消融实验深入分析各模块贡献。

2026-09-10

机器人学基于运动捕捉手套与教师臂的双手机器人遥操作系统设计:复杂灵巧操作任务的数据采集与行为克隆策略训练

内容概要:本文介绍了BiDex——一种低成本、高精度、便携式的双手机械臂灵巧操作遥操作系统,用于收集复杂任务下的高质量机器人行为克隆数据。该系统结合运动捕捉手套(Manus Meta)与仿生教学臂(GELLO),实现对手指和手臂动作的精确追踪,支持超过50个自由度的操作,并可在桌面及移动环境中部署。相比Vision Pro和SteamVR等现有方案,BiDex在任务完成率、响应速度和数据质量方面表现更优,已成功应用于倒水、铲取、锤击、夹取筷子等多种高难度双手机械操作任务的数据采集与策略训练。; 适合人群:机器人学、人工智能及相关领域的研究人员,尤其是从事机器人遥操作、模仿学习、灵巧手控制与数据驱动机器人控制的高校实验室成员或工业界开发者。; 使用场景及目标:①在无外部跟踪设备条件下实现野外(in-the-wild)双手机械臂遥操作;②为复杂灵巧操作任务收集高质量专家演示数据以训练行为克隆策略;③推动低成本、可复现的高自由度机器人控制系统在学术界的普及与应用; 阅读建议:建议结合项目官网(https://bidex-teleop.github.io)提供的视频、组装指南与软件代码进行实践学习,重点关注系统搭建、逆运动学映射、多模态数据同步与策略训练流程,以便完整掌握从硬件集成到机器学习应用的全链条技术细节。

2026-09-10

【机器人学习】基于视觉语言动作模型的跨具身学习框架:利用第一人称人类数据实现灵巧人形机器人控制与高阶任务语义迁移

内容概要:本文提出Ego-Pi框架,旨在通过细粒度对齐人类与人形机器人数据,实现跨具身形态的视觉-语言-动作(VLA)模型微调。该方法基于预训练的T0.5模型,针对灵巧手控制难题,采用双令牌交错动作序列策略,在不修改原模型动作头参数的前提下支持高维双手机械臂控制;提出机器人中心对齐方法,将人类手势直接映射到机器人关节空间,并引入子任务生成等辅助损失以增强高层任务语义迁移能力。实验表明,仅通过人类演示即可让机器人学会颜色分类、技能串联和规则化包装等新任务语义,成功率均达90%以上。; 适合人群:机器人学、计算机视觉与人工智能领域的研究人员,特别是从事模仿学习、跨模态迁移学习及灵巧操作的研究人员;具备深度学习与机器人控制背景的研究生和工程师。; 使用场景及目标:①解决机器人领域数据稀缺问题,利用大规模第一视角人类示范提升机器人学习效率;②实现从人类行为中迁移抽象任务逻辑(如排序规则、多步技能组合)到机器人控制系统;③推动基于基础VLA模型的通用具身智能发展。; 阅读建议:此资源强调系统级设计与工程实现细节,建议结合补充材料中的关节映射公式与训练超参表深入理解技术实现路径,并关注其在不同机械手形态下的性能差异分析,为实际部署提供参考。

2026-09-10

【机器人学习】基于真实经验的灵巧操作策略优化:面向高维动作空间与稀疏奖励的闭环改进框架设计

内容概要:本文提出了一种名为DexPIE的后训练框架,用于从真实世界部署中收集的经验来提升灵巧操作策略的性能。针对灵巧操作任务中高维动作空间和复杂接触动力学带来的挑战,DexPIE通过引入人类干预机制、多阶段DAgger数据采集、相对动作空间中的异步推理以及连续最优性条件引导等技术,有效缓解了演示与部署之间的分布差异,提升了策略评估的准确性和策略改进的稳定性。实验在三个真实世界的长视野灵巧操作任务上验证了方法的有效性,相比基于演示的基准策略,成功率提升了37%,并表现出更强的鲁棒性。; 适合人群:从事机器人学习、强化学习或灵巧操作研究的研究人员与工程技术人员,尤其是关注真实环境下策略优化与人类协同训练的科研工作者。; 使用场景及目标:①解决真实世界中灵巧机械手操作的任务中因延迟、误差累积导致的策略退化问题;②利用有限的人类干预数据实现高效的策略迭代优化;③在稀疏奖励条件下实现更精准的信用分配与价值函数学习。; 阅读建议:本文结合了系统设计与算法创新,建议读者重点关注图1的整体框架与第4节的方法细节,特别是异步推理机制与连续最优性建模的设计思想,并结合附录中的实现参数深入理解其实验可复现性。同时应注意其局限性,如对人工干预的依赖与未来双手机构扩展的可能性。

2026-09-10

神经网络视频编码2020年-2026年相关的算法或者论文【高质量论文,值得学习参考】

2020 ─── DVC奠基 → Scale-Space Flow → M-LVC多帧预测 → HLVC分层质量 → 综述 │ 2021 ─── DVC→TPAMI扩展 → RLVC循环 → 潜空间压缩 → NVC(VAE) → VVC增强 │ 2022 ─── BVI-DVC训练集 │ 2023 ─── Temporal Context Mining(超越H.266/VVC) │ 2024 ─── UCVC统一P/B帧 │ 2025 ─── DCVC-B双向B帧 → ECVC多帧非局部相关(CVPR 2025 SOTA) │ 2026 ─── 并行上下文建模 → 面向机器的NVC → 屏幕内容压缩 → LoRA后滤波

2026-09-08

【机器人操作学习】基于1,500小时双臂操作数据与在线修正的视觉语言动作模型训练:家庭场景物体操控技能迁移系统设计

内容概要:本文介绍了PrimeBot研究团队发布的1,500小时双手机器人家庭操作操纵数据集,涵盖现实世界远程操作与通用操纵接口(UMI)采集的多样化演示数据。该数据集支持训练名为XR-2的50亿参数视觉-语言-动作(VLA)模型,用于实现鲁棒的双手机器人操纵策略。研究系统地探索了专家示范数据和基于DAgger的人类实时纠正数据在策略学习中的扩展规律,发现随着专家数据增加,任务成功率趋于饱和,而引入针对失败状态的在线纠正数据后,性能持续显著提升,验证了两种数据源的互补性。该数据集已开源,推动可复现的双手机器人学习研究。; 适合人群:机器人学、人工智能、计算机视觉及相关领域的研究人员与工程技术人员,尤其是从事模仿学习、强化学习、具身智能和家庭服务机器人开发的专业人士;具备机器学习和机器人控制基础知识的研究生及以上学历人员。; 使用场景及目标:①研究大规模双手机器人操纵的数据驱动方法;②探索专家示范与在线纠正数据在策略训练中的协同作用;③开发适用于复杂家庭环境的长视野、多阶段操纵任务的通用策略模型;④作为基准数据集支持双手机器人学习的算法比较与复现实验。; 阅读建议:此资源强调数据规模与闭环学习机制对策略性能的影响,建议读者重点关注数据收集流程设计、两阶段训练范式(离线微调+DAgger后训练)、技能覆盖统计以及实验中展现出的数据缩放规律,结合附录中的轨迹示例深入理解实际应用场景。

2026-09-07

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除