- 博客(1274)
- 资源 (2)
- 收藏
- 关注
原创 FFmpeg 深度技术剖析:从入门到内核——音视频开发者的终极参考书
适用版本:FFmpeg 7.x(n6.1+ 系列)技术深度:★★★★★(源码级分析,含 H.264 解码器、x264 编码器适配器、滤镜系统、多线程模型等核心模块的深度拆解)FFmpeg 是什么?这个问题听起来简单,但要真正回答清楚,需要从多个维度来理解。最简洁的定义:但这句话远不足以概括 FFmpeg 的真正分量。从工程视角看,FFmpeg 是:从学术视角看,FFmpeg 是:从商业视角看,FFmpeg 是:“FFmpeg” 这个名字本身就有故事:所以 “FFmpeg” 可以理解为"快进到 MPEG 的
2026-06-24 21:09:27
570
原创 ResARC 深度解析:给自回归图像编解码器补上“两个残差“,超低码率再下一个台阶
图 1(论文 Figure 1):0.022 bpp 下 ResARC 与 StableCodec/DiffC/ARPC/ResULIC 的对比——河豚的斑点纹理、潜水员眼睛的轮廓,ResARC 都明显更接近原图。做视频编码的人都懂:码率一压到极限,失真优化路线(Ballé 系的超先验/自回归熵模型)就开始"抹墙"——纹理糊成塑料,因为 RD 优化在像素域 MSE 上算出来的最优解就是模糊。生成式压缩用生成先验"脑补"细节,把主观质量救了回来:第一代用 GAN(HiFiC 一系),第二代用扩散模型(PerC
2026-10-01 20:25:40
114
原创 ChronoGraph 深度解析:当 4D 场景图遇上 VLM,机器人终于知道“该拧哪个旋钮“
设想一个具身任务:从抽屉里取出锅铲放到灶台上。看懂过去:刚才那个动作干了什么?拉了抽屉把手 → 抽屉从"关"变"开",内部物品暴露出来了;定住现在:当前状态下,哪里可以交互?抽屉把手的三维中心点在哪;预测未来:为了"把锅放到灶上加热"这个目标,下一步该干什么?拧哪个旋钮?拧完之后世界会变成什么样?这三件事在现有评测体系里是割裂的。3D/空间推理基准(SpatialVLM、SpatialRGPT 一系)只考空间关系;4D 基准(VLM4D、DSR、MLLM-4D 一系)只考"观察到的物体怎么动";
2026-10-01 15:17:12
323
原创 VALVE:给 Agent 自我进化装一道“验收闸门“——从 1000 任务长跑到 75% 回撤削减
权重冻结的 LLM Agent,能不能在长程部署中通过积累文本经验持续变强,而不是越跑越废?这个方向叫 in-context self-evolution(上下文内自我进化):模型参数一个不动,Agent 解完任务后把可复用的经验蒸馏成技能(skill)和原则(principle),存进一个持久化的技能库(skill bank),下次遇到新任务时检索相关条目注入上下文。听起来很美——不用训练、不用改 harness,纯文本层面"越用越聪明"。现有方法几乎都是在短视距、有界优化设定下评测的。
2026-09-30 17:13:05
15
原创 InfraVLA 深度解析:让机器人“偷看“监控摄像头导航,为什么光加编码器没用?
先说一个特别生活化的事实:你现在走进任何一个仓库、医院、写字楼、火车站,头顶上都挂着一堆摄像头。这些摄像头 7×24 小时看着整个建筑,实时、高清、还免费——毕竟早就装好了。而你派进去干活的机器人呢?它只看自己鼻子底下那一亩三分地。让它"走到那个箱子那儿去",箱子不在它视野里,它就只能一条过道一条过道地搜,搜到一半发现过道尽头被叉车堵死了,还得原路退回来。而头顶的摄像头把箱子在哪、哪条过道堵了看得一清二楚。这就像什么?
2026-09-30 16:01:22
318
原创 拆开 NVIDIA 的黑盒:UHQ 模式四年憋出来的编码效率,代价竟然是它
上个月我拆过 Katto 实验室的 SFE 论文(把一帧切两半给两颗 NVENC 并行编码),当时留了个悬念:SFE 的实验里有个叫的 tuning 模式表现诡异——开 SFE 不升反降,论文只能说"NVENC 内部配置是黑盒,机制不明"。这篇就是解药的续集。同一批作者这次直接把Pascal(GTX 10 系)到 Blackwell(RTX 50 系)四代 NVENC 纵向拉出来遛了一遍。
2026-09-29 20:17:13
135
原创 别再迷信 QoS 了:ns-3 + FFmpeg 直测 H.264 实时流的 QoE 实践
先说个做流媒体的同学大概都经历过的场面:网络侧监控面板一片绿——延迟 40ms、抖动 3ms、吞吐跑满 300kbps,丢包率 0.5%,一切指标"优秀"。然后切到播放器一看:画面糊成马赛克,动作一顿一顿,还有人脸上一秒三张鬼影。这就是 QoS 与 QoE 的经典背离:网络层指标健康,不代表用户看到的画面好看。原因不难理解——H.264 是重时间预测的编码,一个 I 帧的丢包或错误会沿着 P 帧链传播好几个 GOP(错误扩散),网络层只丢了一个 UDP 包,应用层可能烂了 30 帧画面。
2026-09-29 16:36:00
379
原创 NVIDIA SFE(Split-Frame Encoding)深度拆解:一块 GPU 里塞两个编码器,代价到底有多大?
前段时间有个朋友问我:"4 个 720p 的 H.264 码流能不能拼成一个 2K 码流?"当时我的答案是:码流级拼不了,要么转码拼画面,要么渲染端拼显示。然后我读到了这篇论文,发现自己漏了一个重要的"正主"——NVIDIA 的 Split-Frame Encoding(SFE)。把一帧 8K/4K 画面切成两半,交给 GPU 里两颗独立的 NVENC 硬件编码器芯片并行编码,再把两段码流缝合回一个正常的码流。这不就是"切帧 + 并行编码 + 拼接"吗?只不过它是在。
2026-09-28 20:59:44
137
原创 NVENC UHQ 论文深度解析:NVIDIA 把 B 帧堆到 7 层,换来了 22.79% 的码率,代价是什么?
硬件编码器圈子里流传着一个老段子:NVENC 的画质是"能看",x265 的画质是"能看哭对手"。但 2024 年以来风向变了——Ada Lovelace 和 Blackwell 两代显卡引入了一个神秘的UHQ(Ultra High Quality)调优模式,NVIDIA 官方宣称相比标准 HQ 配置能带来最高 15% 的 BD-Rate 改善,甚至开始能和软编过招。第一层:纵向。
2026-09-28 19:33:00
17
原创 ELLMPEG 论文深度解析:把 FFmpeg 命令生成塞进边缘设备的 Agentic LLM
先说结论:这篇论文干的事情一句话就能讲清楚——让一个能跑在你办公电脑 CPU 上的 7B 小模型,本地听懂"帮我把视频旋转 90 度"这种人话,然后吐出一条正确的 FFmpeg 或 VVenC 命令,全程不联网、不花一分钱 API 费。听起来像 LLMPEG(2024 年那个用 GPT-4o 把自然语言翻译成 FFmpeg 命令的开源项目)的翻版?网络依赖:断网或弱网环境下直接歇菜。对流媒体机房、内网后期流水线、隐私敏感的广电环境,这是硬伤不是瑕疵;API 费用。
2026-09-27 21:20:20
147
原创 当环路滤波遇上深度学习:一篇 IEEE TCE 综述的全景精读
先说清楚这篇论文是什么、不是什么。它不是提出新方法的文章,而是一篇覆盖 2016–2025 年约113 篇DLF(Deep Learning-based Filtering,深度学习滤波)工作的系统综述——从 Dong et al. 2015 年那篇把 SRCNN 搬进压缩伪影去除的开山之作,一路数到 2025 年 JVET NNVC 里的 CCLOP、SCM block。它的独特之处也不在"全",而在视角:以往综述(比如 [74]、[121] 相关工作)几乎都只盯着 RD 性能,这篇的副标题里写着。
2026-09-27 14:43:35
112
原创 ConsistWorld 论文深度解析:多智能体世界模型里的“证据路由“,和你编码器里的参考帧管理是同一件事
自回归视频世界模型(Diffusion Forcing、Self Forcing、LingBot-World 这一脉)这两年已经把"给一张初始图 + 一串控制信号 → 流式生成一个连贯的视觉体验"做得有模有样。只有一个观察者。一旦你把"游戏服务器"的梦想升级成"多个玩家同时在一个世界里跑",问题立刻变质。独立控制的多个观察者,必须把同一个场景画得相互一致——哪怕他们从不同视角、在不同时间撞见同一块区域。自我回访(Self-Revisit)
2026-09-25 21:38:25
115
原创 ϕ-RIE 论文深度解析:从“拍照级重建“到“机器人可以动手“的最后一公里
这两年做视频编码和成像的人多多少少都摸过 3D Gaussian Splatting(3DGS):几百万个带位置、协方差、不透明度和球谐系数的各向异性高斯椭球,把一段多视角采集的画面拟合成一个可以实时渲染的辐射场。渲染层面它已经接近完美了—— ScanNet++ 上的源高斯重建 PSNR 可以做到 21.58 dB,肉眼看几乎就是照片。一个渲染得再真实的 3DGS 场景,机器人也拿不起里面的一只杯子。为什么?论文用"机器人拿起桌上的杯子"这个例子拆解得很透彻。分离(Separation)
2026-09-25 20:33:55
196
原创 Video-HopChain:用「多跳求和题」逼视频模型真正去看视频,再用「置信门控探索」救活 GRPO 的废rollout
RLVR(用可验证奖励做强化学习)已经成了推理模型的标准配方:数学和代码先吃螃蟹,图像跟进,视频自然排下一班。大量工作(Video-R1、VideoChat-R1、Video-Thinker……)都在用 GRPO 对着"可验证答案"训视频模型。视频模型经常根本不看视频就作答(Zhang et al. 2026b、Krojer et al. 2025 的 shortcut-aware 基准都在测这个);更扎心的是,模型可能编码了它看到的东西,却仍然靠先验作答。
2026-09-24 21:39:52
50
原创 LLaVA-Assessor:把「看画质」这件事,做成一个基座大模型
你的编码器把码率压下去了,画质到底掉了多少?PSNR 算得快,但人眼不买账;SSIM 好一点,遇到时域抖动、卡顿依然抓瞎。于是有了 VMAF 这类融合模型,有了 MOS 主观打分,也有了一大堆 DNN 时代的 NR-VQA 模型(FAST-VQA、Dover、KVQ、Modular-VQA……)。它们是"哑巴专家"。你问它"这段视频质量多少分",它能吐一个 0.87;你问它"为什么是 0.87",它什么都说不出来。
2026-09-24 17:22:54
881
原创 AV2 评估方法学深度解析:AOMedia 如何科学地“验货“ AV2?——CTC、凸包与 BD-rate 全拆解
AV2 是 Alliance for Open Media(AOMedia)正在开发的 AV1 后继标准。目标很明确:等效视觉质量下码率显著低于 AV1,支撑 UHD-2(8K)流媒体、VR/AR 这类带宽饥渴型应用,同时给复杂度画了硬杠杠——编码器不超过 AV1 的 5 倍、解码器不超过 2 倍(production-ready 实现口径),并延续开源参考实现的传统。但写编解码器的人都知道,一篇 codec 性能论文最值钱的部分往往不是"省了百分之几十",而是这套数字是怎么量出来的。
2026-09-23 21:40:27
339
原创 BiRoAD 论文深度解析:把 Mid/Side 立体声编码的思想搬进双臂机器人
双臂操作(bimanual manipulation)是机器人学习里出了名的硬骨头。两只 Franka 机械臂要协同完成"递花束"“开冰箱放瓶子”“扫土进簸箕"这类任务,难点不在于单臂抓取本身,而在于角色分配:同样是"把香蕉放进抽屉”,抽屉在左边时通常右臂去开抽屉、左臂拿香蕉;抽屉在右边时角色整个反转。哪个臂当"主角"(操作)、哪个臂当"配角"(辅助),完全由场景决定,而语言指令只说"把香蕉放进顶层抽屉",一个字都不提谁干什么。这带来一个数据层面的深层矛盾。人类遥操作采集的演示数据,天然存在。
2026-09-23 21:17:14
272
原创 600 美元的灵巧手遥操作全家桶——GEX 论文深度解析
上一篇我们拆了 MocapRobot(arXiv 2501.04169):用学习式重定向弥合人手→机器手的具身鸿沟,它依赖的真机平台是 xArm6 +——官方零售价16,000 美元起步。灵巧手太贵,遥操作数据采不起,具身智能就成了少数实验室的玩具。平台价格量级特点六位数($100k+)腱绳驱动,拟人,维护噩梦$16,000+直驱,学术圈事实标准LEAP Hand~$2,000直驱 16-DoF,低成本标杆<$600 / 台,<4h 组装直驱 23-DoF 全家桶。
2026-09-21 22:01:14
174
原创 人手技能如何“搬家“给机器手?——MocapRobot 论文深度解析
先说人话版:这篇论文要解决的问题是——你对着摄像头抓一瓶水、翻一本书,机器人手就能照着做。中间不需要你戴上 VR 头显远程操控机器人,也不需要遥操作手套,更不需要你懂任何机器人学。这事儿为什么难?关键词叫具身鸿沟(Embodiment Gap)。人手之于机器手,就像 H.264 的宏块之于 AV1 的 128×128 超级块。编码工具的"语义"相似(都在分块、预测、变换),但参数空间、边界条件、可施加的"力"完全不同。
2026-09-21 15:24:27
458
原创 PerAct2 论文深度解析:双臂操作的“基准“难题——为什么两个独立智能体学不会配合?
2023 年以来,双臂机器人系统肉眼可见地火了起来:波士顿动力 Atlas、特斯拉 Optimus、Figure 人形,以及学术界的 ALOHA 系列。真机系统很多,系统性研究双臂能力的"考场"几乎没有。看看现有的操作基准(Table 1):robosuite 3 个双臂任务、ManiSkill2 只有 2 个、Orbit 1 个,RLBench 虽有 100+ 任务且自带自动路点数据生成(不用人工采演示)这个杀手锏,但双臂任务为零。
2026-09-20 21:45:22
160
原创 CooHOI 论文深度解析:让两个人形机器人学会“搭把手“——物体动力学作为隐式通信的两阶段协作框架
设想一下搬家场景:床、沙发、衣柜——这些大件家具,一个机器人搬不动,必须两个甚至多个人形机器人协同搬运。这个画面在人类世界稀松平常,在机器人学里却是一道坎。数据缺失:多个人形机器人协作的动捕数据几乎不存在。单人的"走路、搬箱子"数据 AMASS 里一抓一大把,但"两个人合力抬一张长沙发"的全身运动捕捉?成本高到没人做。多智能体训练低效。
2026-09-20 11:45:35
168
原创 IACE 深度解析:双臂机器人该怎么“分工“?AIST 用 14 组真机实验给出架构选型指南
双臂操作是机器人操作领域的硬骨头,也是这个系列博客的老朋友了——ALOHA、BRS、iDP3 里都绕不开它。双臂策略网络的架构本身该怎么设计?数据异构性:把两个 6-DoF 单臂(ViperX、UR5)或 7-DoF 臂(Franka)拼成 12/14-DoF 双臂,硬件构型一变,模型就得微调甚至重训——拼维度的做法对硬件差异零鲁棒性;单臂能力被稀释:双臂任务里左右手角色往往不同——“右手抓起物体、左手接住”(hand-over)本质上是两个单臂技能的接力。
2026-09-19 21:29:37
440
原创 LINGO 深度解析:一句“坐到沙发上喝苹果汁“,让数字人自己走过去、坐下、开喝
行走(locomotion):从 A 走到 B,还得绕开桌椅;伸手(reaching):手够到物体,不穿模;人-物交互(HOI):坐下、躺下、拿起、放下——物体状态随之改变。各管一段:行走、够物、交互通常由专门系统分别建模,拼起来的长序列缺乏连贯性,语义对不上;输入太重:很多工作要用户喂物体轨迹人体关键点动作相位标签甚至预定义路径点——用户得当导演逐帧指挥,违背"说一句话就行"的初衷;数据缺口。
2026-09-19 14:09:33
213
原创 BRS 深度解析:斯坦福全家桶让轮式机器人承包家务,JoyCon 手柄立大功
这篇论文的起点很有意思:作者没有先造机器人,而是先做数据考古。双臂协调(Bimanual):搬大件、抱重物绕不开两只手;稳定精确的导航(Navigation):取个东西经常要跨越半个屋子;广域末端可达性(Reachability):作者统计了家庭任务相关物体的高度分布(Figure 2),发现物体高度呈多峰分布——0.09 m(地上)、0.49 m(低位台面)、0.94 m(桌面)、1.43 m(高处架子)。四个峰横跨从地板到超过成年人舒适举手高度(182.9 cm)的范围。视频编码工程师的类比。
2026-09-18 21:24:45
531
原创 iDP3 深度解析:只用一个场景的数据,人形机器人凭什么能在整个世界干活?
人形机器人autonomous操作是机器人学几十年来的圣杯。2024 年硬件层面已经很热闹了——Boston Dynamics 的电动 Atlas、特斯拉 Optimus、Figure 01、宇树 H1,个个都像从科幻片里走出来的。能全身遥操作人形机器人,但学到的操作技能只认训练时那个场景,换个厨房就废;平台不支持移动底座和腰部自由度,工作空间小得可怜;倒是能泛化到新环境,但它靠的是20 个场景的数据堆出来的泛化。论文的 Table I 把这个领域摸了个底朝天:所有已有人形系统里,
2026-09-18 20:07:12
115
原创 沉浸式 XR/AR 实景直播:从采集到光子的全栈技术地图
要可跟踪、要保真、要实时、要省存储,四选三。生产项目目前仍以静态 3DGS 为主,动态多用于数字人这类"主体可控、背景静态"的特定场景——因为数字人场景里静态部分占绝大多数,正好把 4D 的最贵部分省掉了。从"拿到压缩数据"到"光子打到视网膜"。这段预算通常只有 10~20ms,而人脑对"头动了但画面没动"的容忍度极低——这就是所谓motion-to-photon(MTP)延迟问题,超过阈值就会引起晕动症(cybersickness)。最后是显示端自身的指标,这些数字决定了前文所有努力的"终点门槛"。
2026-09-17 17:19:51
168
原创 实时生成式数字人直播:33ms 帧预算下的全链路技术拆解
实时生成式数字人 = 四个降:降维、降步、降幅、降耦。所有技术路线都在这个坐标系里。速度数字必须绑定分辨率与硬件看。12.8ms/帧(256², 4090)和 32 FPS(14B, 多卡)是两个不同世界的东西。直播优化吞吐,对话优化时延。把两者混为一谈会做出"延迟漂亮但一直卡"的系统。稳定性比画质更难。抖动、漂移、误差累积这三个问题,靠 PSNR 测不出来,必须上时域指标与盲测。工程细节决定成败。
2026-09-17 16:59:38
167
原创 WebRTC 直播端到端延迟降到 200–400ms:0-RTT 信令、MiniSDP 压缩与柔性 FEC(RLNC)的标准化落地全拆解
先说新闻背景,免得你以为我在画饼。2026 年 6 月 1 日,中国通信标准化协会(CCSA)发布了通信行业标准YD/T 7060-2026《基于 WebRTC 的超低延时直播协议技术要求》,并于2026 年 9 月 1 日正式实施——也就是说,就在本月。MiniSDP 压缩(信令压进单个 MTU)、0-RTT 信令交互、柔性 FEC(FlexFEC 及 RLNC 类网络编码)。
2026-09-16 18:16:17
155
原创 NNVC 神经视频编码与 AI 辅助编码实战:当编解码器开始“长脑子“
每一代都是"混合编码框架"的精细化——更聪明的划分(QTMT)、更细的预测(AFFINE/SMVD)、更灵活的变换(MTS/LFNST)、更强的环路滤波(ALF/SAO)。收益在递减:HEVC 相对 H.264 省 ~50% 码率,VVC 相对 HEVC 再省 ~50%,但复杂度的增速已经远超压缩收益的增速——VVC 的解码复杂度是 HEVC 的 2~4 倍,编码复杂度更是数倍以上。靠"手工设计工具箱"这条路,边际收益正在快速逼近零。路线 A:神经工具嵌入标准编码器(NNVC)。
2026-09-16 17:58:07
431
原创 AV2 深度拆解:30% 码率红利到底从哪来?
AV2(AOMedia Video 2)是开放媒体联盟于 2026 年正式发布的下一代开源、免版税视频编码标准,是 AV1 的继任者。维度AV2 规格规范版本v1.0.0(2026-05-28 定稿公开,2026-06-09 正式发布公告)参考软件规范获取色度格式4:0:0 / 4:2:0 / 4:2:2 / 4:4:4(按 profile)位深8 / 10 bit(12-bit 专业档已在 VCWG 立项)最高级别压缩效率同质量下较 AV1 约省 30% 码率(客观指标)
2026-09-16 17:11:38
733
原创 当灵巧手遇上“偏科“的强化学习:北大 UniDexFPM 深度拆解
先讲一个生活场景:桌上一瓶喷雾液躺平了。你要用它,得先把它扶起来,转到喷头朝外的角度,手指还得落在扳机上——注意,不是"能抓起来"就行,是必须精确地摆到一个功能位姿(functional grasp pose),然后才能按下一次成功的抓取。功能性预抓取操作传统 pre-grasp:把物体从"抓不到"变成"抓得到"就行。目标粗粒度——比如把被桌子挡住的物体推出来。已经有一堆工作用平行夹爪借桌子、借墙壁实现。本文的任务:物体本身可达,但要把它摆弄到一个精确指定的六自由度位姿 + 十八个手指关节角度。
2026-09-16 10:52:22
78
原创 DexCap 深度解析:给机器人“攒数据“的神器——穿在人身上的动捕系统,如何让灵巧手学会用剪刀
DexCap 是一套穿在人身上的便携式手部动捕系统——电磁场手套捕手指 + SLAM 相机捕手腕 6-DoF + 胸前 LiDAR 相机捕 3D 场景,让人不碰机器人就能在野外采集高质量操作数据;配套的 DexIL 算法通过指尖逆运动学重定向 + 点云扩散策略,让机器人零真机数据学会剪剪刀、开茶罐这类操作,再加一个"人在环残差修正"机制兜底,30 分钟人类数据就能把成功率干到 72%。(2406.14655):显式分层派——LLM 编排 + RL 技能库 + 优化器兜底;GR00T N1。
2026-09-15 22:36:09
367
原创 HYPERmotion 深度解析:当人形机器人学会“自己想招“——LLM 规划 + RL 技能库 + 全身优化的混合行为规划框架
这篇论文给一台半人马造型的四足轮腿人形机器人(38 个自由度)装上了一整套"大脑—小脑—脊髓"分层系统——LLM 负责想(把一句自然语言拆成任务图)、VLM 负责选(单臂还是双臂、轮子还是腿)、强化学习负责练(把每个技能练成肌肉记忆存进动作库)、全身优化负责兜底(保证练出来的动作物理上真能做)——最终让机器人听懂一句"把抽屉打开、拿起电钻、放进盒子、交给那位同学",然后零样本在线规划、真实世界里把它干完。搞视频编码的人对这个分层结构应该有天然的亲切感。你想想 x265 的码控体系:顶层EncGOP。
2026-09-15 20:52:39
438
原创 AI 实战两年:80% 程序员都用错了
先交代一下背景,免得你看完觉得"这人谁啊就来指点我"。我在北京,写代码写了十一年。前六年做后端,后五年转做视频编解码——对,就是那种又硬又冷、面试官都不太愿意问的方向。日常跟 x265、VTM、FFmpeg 打交道,看的是 CABAC 熵编码、RDOQ 率失真优化、ALF 自适应环路滤波这些玩意儿。偶尔也写点 Python 做图像处理,用 Pillow 做美颜链路的验证。2024 年初,我第一次认真用 ChatGPT。那时候我嗤之以鼻:“这不就是个高级点的自动补全吗?”2024 年中,Cursor 出来,我
2026-09-14 15:19:50
523
原创 GAGrasp 深度解析:把“对称性“焊死在网络里,让机械手转着方向也会抓
灵巧抓取(dexterous grasping)是机器人操作里的"珠穆朗玛峰":给定一个物体的点云观测OOO,你要生成一组灵巧手(比如 Shadow Hand,24 个关节)的配置,让它稳稳地把物体握住。这和平行夹爪(parallel-jaw gripper)那种"一夹了之"完全不是一个难度量级——24 个自由度的耦合、多指接触的力学平衡、手掌姿态的六自由度选择,每一步都是坑。物体转个方向,模型就不会抓了。
2026-09-14 11:45:26
423
原创 DexGraspNet 论文深度解析:132 万条灵巧手抓取是怎么“炼“出来的
机器人抓取这个领域,平行二指夹爪(parallel-jaw gripper)已经被研究得明明白白——ACRONYM、GraspNet-1Billion 这些数据集动辄百万级抓取标注,视觉抓取方法(Contact-GraspNet、VGN 等)也已经能在杂乱场景里实时出 6-DoF 抓取位姿。为什么?因为二指夹爪的抓取位姿最多7 个自由度就能完整描述:平移 3 维 + 旋转 3 维 + 指间距 1 维。搜索空间小,问题就好做。
2026-09-13 18:21:25
230
原创 CogRobot 论文深度解析:当视频编码的“老朋友“光流,成了机器人双臂操作的“中间表示“
单臂机器人操作,相当于单声道;双臂操作(bimanual manipulation)是立体声——不是简单多一路,而是两路信号之间还要有相位协调。你想想人拧瓶盖:左手固定瓶身、右手旋转瓶盖,两个末端执行器之间存在动态的力学耦合与角色分工。动作空间爆炸:两个 7-DoF 机械臂 + 两个夹爪,联合动作维度直接翻倍,而且双臂协作天然是多模态的(同样的任务有一堆合法的协作方式),数据覆盖要求极高;数据极度稀缺:互联网上单臂机械臂视频都算稀有,高质量双臂遥操作数据更是凤毛麟角。
2026-09-13 17:26:35
148
原创 SimToolReal 解读:用“物体中心“视角重新定义灵巧工具操作
SimToolReal 为灵巧工具操作领域提供了一个令人耳目一新的视角:与其教机器人"学会用每种工具",不如教它"学会将任何东西送到目标位姿"。这个看似简单的问题重述,实际上触及了机器人学习中一个更深层的问题——通用性究竟应该编码在策略中,还是编码在任务表示中?SimToolReal 的回答是:策略负责通用技能(抓取、重定向、稳定控制),任务表示负责特定意图(目标位姿序列)。这种分工让策略可以专注于底层物理交互的学习,而不被上层任务的语义复杂性所干扰。
2026-09-12 21:58:21
314
【自然语言处理】基于数据高效的可验证奖励强化学习框架:大规模语言模型推理能力优化系统设计
2026-09-07
【音频信号处理】基于自监督语音模型的歌唱发声模式分类:声学特征迁移学习在嗓音质量识别中的应用研究
2026-08-29
音频处理基于1D可变形注意力的开放世界声音事件检测框架:未知事件识别与增量学习系统设计
2026-08-28
【多模态欺骗检测】基于差异感知动态融合的视听欺骗检测框架:ReDA网络设计与状态评估
2026-08-28
【计算机视觉】基于RGB-D数据的视觉语言模型空间理解增强方法:SpatialBot框架与SpatialQA系列数据集构建
2026-08-21
【机器人操作】基于多模态大模型的统一机器人脑框架:从抽象指令到具体动作的跨模态任务规划系统研究
2026-08-20
机器人学基于视觉-语言-动作模型的通用人形机器人基础模型:GR00T N1的架构设计与多模态数据训练方法研究
2026-08-19
【机器人控制】基于结构化动作空间探索的强化学习框架:面向流匹配视觉-语言-动作模型的在线自适应方法
2026-08-18
【计算机视觉】基于密集预测的结构化监督:统一图像视频生成与编辑框架设计
2026-08-18
【计算机视觉】基于深度学习的动作质量评估十年综述:技术演进、挑战与未来方向在体育、医疗等领域的应用研究
2026-07-28
视频生成基于Diffusion Transformer的统一视频创作与编辑框架:支持多模态输入与任务组合的全功能视频合成系统设计
2026-07-14
【视频生成与推理】基于Chain-of-Frame的OPENCoF框架:通过多源监督数据与视觉-文本推理令牌提升视频生成模型的时空逻辑推理能力
2026-07-12
【机器人视觉动作模型】基于时序比率的推理时自适应引导方法:视频-动作泛化差距缓解与组合性迁移能力提升研究
2026-07-10
基于HEVC的CU级别视频隐写技术
2026-06-18
【计算机视觉】基于Transformer的视频恢复模型:多尺度时空注意力与并行修复架构设计(提供源码)
2026-06-19
【机器人视觉】基于HEVC与JPEG混合传输的带宽受限遥测系统:无人机视觉中ROI图像增强的目标识别性能优化
2026-06-19
视频生成基于谱域前向预测校正的运动一致性文本生成视频方法:SpecLoR技术实现高效轨迹纠偏与物理合理性增强提供源码
2026-06-13
【机器人控制】基于语义视觉-动作分词器的世界模型:RepWAM框架在真实与仿真操作任务中的性能评估提供源码
2026-06-13
语音翻译基于偏好学习的流式语音到语音翻译优化:减少打断性停顿以实现自然语音流畅度
2026-06-13
【多媒体处理】基于边缘计算的代理式大语言模型框架:面向FFmpeg与VVenC视频编码命令生成的高效本地化系统设计
2026-09-28
【机器人操作】基于量化手部状态的灵巧操作学习:机械臂-手协同控制策略研究
2026-09-25
【计算机视觉】基于感知决策机制的多模态大模型视觉质量评估系统:面向图像与视频的统一质量解释与评分框架设计
2026-09-24
【视频编码技术】基于AV2标准的压缩性能评估方法与质量增益分析:面向下一代流媒体应用的标准化测试框架设计
2026-09-24
【机器人学习】基于对称-反对称分解的双臂操作角色自适应表示学习:面向场景条件下的双臂协调控制策略机器人学基于对称-反对称分解的双臂操作角色自适应表示学习:面向场景条件下的双手机械臂协同控制策略优化
2026-09-23
机器人学基于大语言模型与蒙特卡洛树搜索的双臂灵巧操作数据生成框架:面向人形机器人的高精度任务规划与仿真演示收集
2026-09-14
【机器人操作】基于点轨迹跟踪的通用灵巧操作策略:面向真实场景的任务无关Sim-to-Real框架设计
2026-09-14
OpenEgo,一个大规模多模态的自我中心操作数据集,旨在推动灵巧操作的视觉-语言-动作学习
2026-09-14
机器人学基于操作类型的灵巧遥操作系统TypeTele:融合多模态大模型的遥操类型检索与插值映射策略
2026-09-14
【计算机视觉】基于大规模第一人称视频的灵巧操作学习数据集EgoDex构建与基准评测
2026-09-14
机器人学基于运动重定向的灵巧手遥操作系统:20自由度仿人机械手高保真动作复现与协调控制
2026-09-14
【机器人操作】基于空间锚定触觉感知的灵巧操作框架:高精度装配任务中的几何推理与控制
2026-09-14
机器人学基于LiDAR的全景感知操控策略:面向大范围工作空间人形机器人灵巧操作的端到端3D视觉运动控制方法
2026-09-10
机器人学基于几何与空间手物表征的灵巧操作学习:DexRepNet++多任务通用抓取与重定向系统设计
2026-09-10
【机器人学习】基于仿真数据的类人机器人操作框架:OASIS系统在零样本真实场景部署中的应用研究
2026-09-10
机器人学基于运动捕捉手套与教师臂的双手机器人遥操作系统设计:复杂灵巧操作任务的数据采集与行为克隆策略训练
2026-09-10
【机器人学习】基于视觉语言动作模型的跨具身学习框架:利用第一人称人类数据实现灵巧人形机器人控制与高阶任务语义迁移
2026-09-10
【机器人学习】基于真实经验的灵巧操作策略优化:面向高维动作空间与稀疏奖励的闭环改进框架设计
2026-09-10
神经网络视频编码2020年-2026年相关的算法或者论文【高质量论文,值得学习参考】
2026-09-08
【机器人操作学习】基于1,500小时双臂操作数据与在线修正的视觉语言动作模型训练:家庭场景物体操控技能迁移系统设计
2026-09-07
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅
1