- 博客(277)
- 收藏
- 关注
原创 RC-NF深度解析:基于机器人条件归一化流的机械臂操作实时异常检测框架
用条件归一化流建模“任务-机器人-物体”的联合正常分布,实现毫秒级无监督异常检测,给VLA机器人装上实时安全闸。
2026-07-23 11:57:01
90
原创 RehearseVLA深度解析:基于物理一致世界模型的VLA强化学习后训练框架
用物理一致的世界模型搭虚拟训练场,配VLM智能裁判打分喊停,让VLA模型在彩排中迭代进化,少样本下也能练出强泛化的机器人策略。
2026-07-21 17:16:30
369
原创 Video2Robo深度解析:基于3D高斯溅射的单视频机器人演示数据生成框架
单目视频解析3D技能,3DGS编辑生成多样化数据,零硬件实现规模化机器人学习。
2026-07-21 10:59:11
331
原创 Real2Edit2Real:通过三维控制接口生成机器人示范数据
使用5条真实数据生成训练集后,成功率分别达到78.8%和81.3%,提高17.5和20个百分点。但其“少样本”主要指生成阶段,底层模型仍使用10万真实深度数据、4万仿真帧和7000条视频,并依赖8张H100训练。视觉语言动作模型和扩散策略依赖大量高质量机器人示范数据,但真实数据采集成本高,有限数据训练出的策略往往难以适应新的物体位置、朝向和场景高度。论文希望从少量真实 RGB 示范中生成大量具有新物体位置和新操作轨迹的多视角示范,不依赖仿真引擎和物体数字资产。,即可达到或超过50条真实示范的效果。
2026-07-20 14:20:45
393
原创 Real2Edit2Real:3D控制接口驱动的机器人演示数据生成框架深度解析
机器人学习的近期进展由大规模数据集与强大的视觉运动策略架构共同推动,但策略的泛化能力始终受限于多样化演示数据的高昂采集成本,在机械臂操作任务的空间泛化场景中尤为突出。为减少重复的数据采集工作,本文提出Real2Edit2Real框架,通过一套3D控制接口搭建3D可编辑性与2D视觉数据之间的桥梁,实现全新演示数据的生成。本方法首先通过度量尺度3D重建模型,从多视角RGB观测中恢复场景几何结构;
2026-07-20 14:19:27
360
原创 ODTSR:面向可控真实世界图像超分辨率的一步扩散Transformer
一步方法如OSEDiff、PiSA-SR和TSD-SR速度快、保真度较好,但经过针对重建任务的微调后,往往丢失预训练文生图模型的提示词控制能力。Baseline可采用ODTSR、IFCSR、PiSA-SR、TSD-SR、OSEDiff、SUPIR、DiT4SR,以及SwinIR、HAT。在DIV2K-Val上取得DISTS 0.1700和FID 21.47,但PSNR、SSIM并非全面最优,说明它主要改善感知与分布质量,而不是纯像素重建。生成器使用MSE与LPIPS重建损失,同时加入相对式GAN损失。
2026-07-16 17:33:45
335
原创 IFCSR:面向一步扩散式真实世界图像超分辨率的无需额外推理保真度-真实感控制
已有可控扩散超分方法如PiSA-SR、StableSR和PASD,可以通过参数调节保真度与真实感,但控制通常发生在潜空间。评价指标除PSNR、SSIM、NIQE、MUSIQ通用图像指标外,额外增加工业专属指标:缺陷Dice、缺陷召回率、虚假缺陷生成比例、调控曲线单调性、单图推理耗时。Baseline建议保留IFCSR、PiSA-SR、OSEDiff、SinSR、StableSR、DiffBIR,以及SwinIR、HAT等非生成式方法。,浅层侧重边缘保真、深层侧重真实感,拓宽可调区间。
2026-07-16 17:28:30
484
原创 DualAnoDiff:用于小样本异常图像生成的双关联扩散模型
工业制造场景下的异常检测性能受限于异常样本的稀缺性。为解决这一问题,研究者开始采用异常生成方法扩充异常数据集。但现有异常生成方法存在生成异常多样性不足、异常区域与原图难以自然融合的问题,且生成的掩码通常与实际异常区域无法对齐。本文从全新视角解决上述挑战:同时生成完整异常图像与对应的异常区域图像对。我们提出,一种基于扩散模型的少样本异常图像生成新模型。它通过双路互关联的扩散结构,一路生成完整图像,另一路生成异常区域,能够生成多样且真实的异常图像。
2026-07-14 16:21:42
346
原创 RealNet:用于异常检测的特征选择网络,具备真实的合成异常样本
自监督特征重建方法在工业图像异常检测与定位任务中已展现出良好的发展前景。尽管取得了一定进展,但这类方法仍面临两大核心挑战:一是难以合成真实且多样化的异常样本,二是无法有效解决预训练特征存在的冗余性与预训练偏差问题。针对上述问题,本文提出RealNet——一种具备真实合成异常生成能力与自适应特征选择机制的特征重建网络。该方法包含三项核心创新:第一,提出强度可控扩散异常合成(SDAS)策略,基于扩散过程生成不同异常强度的样本,其分布与真实异常样本高度吻合;第二,设计异常感知特征选择。
2026-07-14 14:58:01
325
原创 AdaBLDM论文深度解析:带在线自适应的混合潜扩散工业缺陷生成方案
有效解决工业异常检测(AD)任务需要充足的缺陷样本支撑,但工业场景中缺陷样本往往十分稀缺,这一约束严重限制了检测算法的性能。本文提出一种全新的缺陷样本增广算法,通过生成高质量缺陷样本提升异常检测性能。该方法针对缺陷生成任务定制化改造了混合潜扩散模型,在潜空间中通过扩散模型生成缺陷样本,并通过“三值图(trimap)”掩膜与文本提示控制的特征编辑过程对生成结果进行精细化修正。图像生成推理过程分为三个阶段:自由扩散阶段、编辑扩散阶段、在线解码器自适应阶段。
2026-07-13 22:34:52
775
原创 Anomalydiffusion复现
准备 MVTec 数据集路径。如果你要,我可以下一条直接给你整理成一份可放进。README 给出的入口是。,生成数据和评测也会用到这个路径。的中文版“复现指南”。
2026-07-13 15:35:53
157
原创 RoCo:迭代目标匹配与位姿图优化,打造噪声鲁棒的协同感知系统
先把协同感知的通用流程用数学语言说清楚,方便理解RoCo是在哪一步发力的。假设场景里有NNN个智能体(车/路侧单元),对于第iiiXiXi:原始观测数据(激光雷达点云)FiF_iFi:编码器提取的特征图Mj→iMj→i:第jjj个智能体发给第iii个的协作消息OiOi:最终的感知输出(检测框)FiΦEncXii1⋯NMj→iΦProjξiFjξjj1⋯N;j≠i。
2026-07-08 16:20:32
343
原创 视图集合化+轻量Transformer:VSFormer开启多视图3D形状理解新范式
先把问题用数学语言说清楚。对于一个3D形状sss,它的MMM张渲染视图记为v1v2vM∈RH×W×Cv1v2...vM∈RH×W×C,每张都是标准的RGB图像。我们把这些视图构成一个集合Vv1v2vMVv1v2...vM集合的核心性质是置换不变性(permutation invariant):随便打乱视图的顺序,最终的识别结果都应该完全一样。
2026-07-08 15:58:37
397
原创 【DMS】双层多尺度星图驱动的低重叠3D点云精准配准
先把问题用数学语言说清楚。给定源点云Ppmm1MPpmm1M和目标点云Qqnn1NQqnn1N,每个点都是三维坐标。我们的目标是找到一组对应点集CC,然后基于对应点算出最优刚性变换TCTC,让变换后的源点和目标点误差最小。
2026-07-08 15:28:27
354
原创 MambaVO:基于序列匹配精修与平滑训练的端到端深度视觉里程计深度解析
MambaVO的核心贡献,是精准抓住了学习优化类视觉里程计的三个核心痛点,用“鲁棒初始化+序列匹配精修+平滑训练”的组合拳给出了系统性的解决方案。更重要的是,它首次把Mamba状态空间模型引入了VO领域,证明了序列建模对帧间匹配的巨大提升作用,为后续研究打开了新的思路。可以进一步融合IMU惯性信息,做成视觉惯性里程计(VIO),应对快速运动、纯旋转等更极端的场景;可以结合动态物体剔除,提升动态场景下的鲁棒性,适配人流密集的商场、园区等场景;
2026-07-07 11:42:07
303
原创 Point-Cache:测试时动态分层缓存机制,构建鲁棒可泛化的点云分析框架
Point-Cache的核心贡献,是找到了一个非常巧妙的切入点:不用改训练、不用反向传播、不依赖训练数据,只靠测试时在线构建分层缓存,就能同时提升点云模型的鲁棒性和泛化性,还能支持开放词汇的新类别识别。全局缓存把握整体语义,局部缓存补全细粒度结构,动态更新机制保证缓存始终高质量,最终用几乎可以忽略的开销,换来了稳定且显著的性能提升。可以进一步引入时序信息,在视频流、连续扫描场景下做时序缓存,进一步提升连续帧的稳定性;
2026-07-07 10:54:25
506
原创 LA-MOTR:可学习关联驱动的端到端多目标跟踪模型深度解析
LA-MOTR的核心贡献,是精准抓住了端到端Transformer跟踪里“检测与关联任务冲突”这个本质问题,用“解耦+可学习关联”的组合拳给出了一套优雅又有效的解决方案。SOTD从结构上解决任务干扰,SGLA从机制上替代手工关联规则,两者协同发力,在多个场景下都实现了性能的显著提升。可以进一步引入运动预测先验,让空间权重更符合物体的运动规律,进一步提升高速运动场景的跟踪稳定性;可以结合轻量化设计,部署到边缘端摄像头,实现实时在线跟踪;
2026-07-07 10:16:39
320
原创 LeRobot + LIBERO 机器人仿真评估全流程:模型下载、环境搭建与踩坑指南
国内下载 Hugging Face 模型优先使用镜像,Win10 下载后传输到服务器,稳定性远高于服务器直接下载;EGL 相关包编译必须提前配齐系统图形依赖,并用参数确保 cmake 可被构建环境调用;LIBERO 数据集路径与 Gated 模型权限是两大隐形卡点,提前准备可大幅减少调试耗时。
2026-07-04 21:23:49
415
原创 【多模态微调实战】Qwen2-VL + LoRA + SwanLab:手把手教你在COCO数据集上微调通义千问多模态大模型
✅ Qwen2-VL 多模态模型的加载与数据预处理✅ 使用 LoRA 对大模型进行轻量化微调✅ SwanLab 可视化监控训练全过程✅ 训练完成后加载 LoRA 权重做推理✅ 看懂 loss 曲线,判断是否过拟合这套流程可以直接迁移到你自己的数据集上,不管是做工业缺陷图文描述、文档VQA还是其他多模态任务,换个数据格式就能直接开训。2B 只是入门款,想效果更好可以上 7B 版本,原理完全一样,就是显存要求高一些。祝大家炼丹顺利!参考资料Qwen2-VL官方文档。
2026-07-01 15:58:58
481
原创 【AhaRobot】:千元级开源双臂移动操作机器人——具身AI的低成本硬件落地范式
AhaRobot这篇工作最让人兴奋的点,不是做出了什么性能逆天的机器人,而是它把具身AI的入场门槛拉到了前所未有的低度。以前做真实机器人研究,得有几十万的设备预算,普通高校、小团队根本玩不起;现在一万多块钱就能攒一套完整的双臂移动机器人,学生在宿舍都能搞具身智能研究。再加上低成本的远程遥操作方案,未来甚至可以像众包标注数据一样,让大量普通人参与给机器人录演示,彻底解决具身AI的数据荒。整机还是偏重,51公斤,搬起来费劲,而且没有碰撞检测,撞一下容易坏;
2026-06-27 11:41:04
372
原创 【LeRobot】:端到端机器人学习的全栈开源框架——从硬件驱动到模型训练部署的完整闭环
LeRobot这篇工作最大的意义,不是提出了什么惊世骇俗的新算法,而是它把机器人学习的门槛拉到了前所未有的低度。以前做机器人学习,你得是懂硬件、懂软件、懂算法的全栈工程师,一个人干一个团队的活;现在,哪怕你是个只会Python的学生,花一千多买个机械臂,装个LeRobot,一周就能跑通最新的算法。就像当年Arduino让人人都能玩硬件、TensorFlow让人人都能玩深度学习一样,LeRobot正在让“人人都能玩机器人学习”变成现实。
2026-06-27 11:21:12
349
原创 【World Models】:基于生成式世界模型的强化学习框架
环境给的输入是高维的RGB图像(比如64×64×3的像素),直接丢给控制器根本处理不动。V模型的任务就是做有损压缩:把一整张图压缩成一个短短的隐向量zzz,丢掉没用的细节,保留和任务相关的核心信息。这里用的是变分自编码器(VAE),它和普通自编码器最大的区别是:隐向量不是一个固定的值,而是服从正态分布的随机变量,这样隐空间会更连续、更适合后续的预测模型采样。
2026-06-27 10:15:01
384
原创 【FAST】:基于频域压缩的通用视觉-语言-动作模型高效动作令牌化技术深度解析
我们的目标是训练策略πa1H∣oπa1H∣o:给定观测ooo,输出长度为HHH的未来动作序列(动作chunk)。Taa1H→T1T2TnTaa1H→T1T2...TnTaT_aTa:动作令牌化映射函数,输入连续动作,输出离散令牌序列a1Ha_{1:H}a1H:长度为HHH的连续动作chunk,每个时间步包含∣A∣|A|∣A∣。
2026-06-26 16:30:07
302
原创 【π₀】:基于流匹配的通用机器人视觉-语言-动作基础模型深度解析
模型建模的是条件动作分布pAt∣otpAt∣ot,即给定当前观测时,未来动作序列的概率分布。观测oto_tot:包含2~3张RGB图像、语言指令序列、机器人本体关节状态,即otIt1ItnℓtqtotIt1...Itnℓtqt。动作序列AtA_tAt:长度为H50H=50H50的未来动作chunk,包含位置、姿态、夹爪、底盘等维度,最大支持18自由度(双臂+移动底盘+升降躯干)
2026-06-26 15:45:22
314
原创 【SmolVLA】:轻量级视觉-语言-动作机器人模型的技术原理与落地实践
小体量也能有高性能:4.5亿参数的SmolVLA,在多个基准上超越30亿+参数的VLA模型,证明VLA领域不是“越大越好”,合理的架构设计和训练目标能带来极高的性价比。社区数据有大价值:仅用2万多条社区演示预训练,就能带来显著的泛化提升,说明低成本机器人数据也能撑起通用策略,不用全靠工业级大数据。工程优化打通落地最后一公里:层截断、token压缩、异步推理这一套组合拳下来,消费级显卡甚至CPU都能跑,真正把VLA从实验室带到了普通人手里。
2026-06-26 14:52:57
377
原创 【OpenVLA】:开源视觉-语言-动作通用机器人策略的技术原理与落地实践
开源VLA首次超越闭源标杆:OpenVLA用1/7的参数量,在29个任务上全面超越55B的RT-2-X,把通用机器人策略的性能和可及性都推到了新高度。微调落地路径跑通:从全量微调到LoRA高效微调,再到量化推理,整条落地链路都验证过了,消费级硬件就能用,不再是实验室专属玩具。设计经验可复用:双路视觉编码器、微调视觉主干、分位数动作离散化、多轮训练这些最佳实践,给后续做VLA的研究者踩平了很多坑。
2026-06-26 14:33:14
511
原创 【Diffusion Policy】基于条件去噪扩散的机器人视觉运动策略学习深度解析
扩散模型用于机器人策略学习效果显著,在11个任务上平均超越之前最优方法46.9%,是当前行为克隆领域的新标杆。滚动时域多步预测、位置控制、高效视觉条件化、推理加速这几项设计至关重要,是算法从“实验室demo”走向“真实机器人可用”的核心工程保障。扩散策略训练稳定性高、超参数通用性强,大幅降低了机器人策略的调参落地成本。
2026-06-26 14:16:08
325
原创 【Action Chunking with Transformers 精读】:低成本双臂机器人的精细操作革命
πθat∣stπθat∣stπθattk∣stπθattk∣st字母逐项解释πθ\pi_\thetaπθ:参数为θ\thetaθ的策略神经网络ata_tat:第ttt时刻的动作,本文中是双臂14个关节的目标角度,14维向量sts_tst:第ttt时刻的观测,包含4路RGB图像+双臂当前关节位置kkk:分块大小,也就是一次预测的未来动作步数attka_{t:t+k}a。
2026-06-23 21:05:55
169
原创 【读书笔记】《金钱心理学》完结篇:终极真相与作者亲授的可落地理财方案
永远不要相信“无风险高收益”的神话,它要么是骗局,要么隐藏着你没看到的成本;做任何投资决策前,先问自己:“我需要为此付出什么代价?接受“合理的平均收益”,是避免被隐性成本收割的最好方式。理财没有标准答案,适合自己的才是最好的;别盲目跟风别人的投资决策,先搞清楚自己的情况;不要用别人的尺子衡量自己的财富进度,你的人生和他不一样。别被悲观主义的叙事裹挟,它天生就有传播优势,但不一定是真相;理性的乐观主义,是长期财富积累的最大红利;长期乐观,短期谨慎,是最好的投资心态。
2026-06-23 20:04:34
202
原创 《小狗钱钱》13-18章精读笔记:从理论到实战的财富自由终章
危机应对法则:建立应急基金,保持现金流健康,直面问题不逃避基金投资法则:选择成立10年以上的大型跨国基金,长期持有,定期定投恐惧克服法则:直接去做你害怕的事情,用真实的经历和感受去分享市场波动法则:不要追涨杀跌,只有卖出才会真正亏损,耐心是投资最重要的品质风险管理法则:没有绝对安全的投资,根据年龄调整投资组合,分散风险财富意义法则:财富的真正意义是自由和帮助别人,而不是占有《小狗钱钱》虽然是一本写给孩子的童话,但它所讲述的财富法则,却是放之四海而皆准的真理。
2026-06-23 20:04:19
149
原创 【读书笔记《金钱心理学》第8-14章:从消费陷阱到长期主义,守住财富的终极心法
炫耀性消费无法带来真正的尊重,只会让你陷入“赚更多-花更多-更焦虑”的循环;别用负债换面子,真正的富有,藏在看不见的地方;比起别人的眼光,更重要的是你自己的财务安全。真正的财富,是你未被消费的部分,而非你拥有的消费品;别把高收入等同于富有,留住钱比赚钱更重要;克制当下的消费欲望,是积累长期财富的第一步。存钱是无需天赋和运气的财富心法,人人都可以复制;存款不是“闲置资金”,而是你人生的“选择权和安全感”;存钱的核心,是对抗人性的即时满足,延迟消费欲望。
2026-06-23 20:03:09
136
原创 【读书笔记】《金钱心理学》前7章深度解读:财富的底层逻辑,藏在人性里
别轻易评判别人的财务决策,你没走过他的路,就不懂他的“金钱逻辑”;个人经历比书本知识更能塑造金钱观,承认差异,才能理解他人;金融市场只有几十年历史,我们都是新手,犯错很正常。成功永远包含运气成分,别高估自己的能力,保持谦逊;失败永远藏着风险因素,别低估别人的困境,学会敬畏;投资的第一原则,是“活下去”,别让一次风险毁掉全部人生。别让社会比较,偷走你的幸福感;学会定义“足够”,是获得财务自由和人生幸福的关键;比起“赚更多”,更重要的是“别被欲望推着走”。
2026-06-23 20:02:54
133
原创 《小狗钱钱》7-12章精读笔记:从储蓄到投资的财富进阶之路
养鹅理论:储蓄是财富增长的基石,永远不要杀死你的"鹅"复利效应:时间是财富最好的朋友,每天进步一点点,长期积累会产生惊人的效果72公式:用72除以年收益率,快速计算资产翻倍时间;用72除以通货膨胀率,计算货币贬值一半的时间收入分配:采用50/40/10原则,平衡现在的消费和未来的投资勇气与行动:勇敢不是没有恐惧,而是带着恐惧依然前进,行动是克服恐惧的最好方法影响他人:先改变自己,用实际行动和结果去影响家人和朋友投资三原则:安全第一,收益第二,分散投资,永远不要投资你不了解的东西圈子的力量。
2026-06-23 20:02:36
189
原创 《小狗钱钱》1-6章精读笔记:开启财富自由的启蒙之旅
明确目标:列出你想要变得富有的10个理由,然后选出3个最重要的视觉化梦想:制作梦想相册,每天进行视觉化练习,想象自己已经实现了梦想立即行动:不要犹豫,不要找借口,决定做的事情要在72小时内开始行动发挥优势:从自己喜欢且擅长的事情做起,帮助别人解决问题坚持习惯:每天花10分钟做对未来有重大意义的事情理性消费:注销信用卡,消费前先问自己"这真的有必要吗?管理债务:遵循四条债务管理原则,避免陷入债务陷阱开始储蓄:即使收入很少,也要开始储蓄,培养储蓄的习惯。
2026-06-23 20:02:05
499
原创 Windows 上使用 VSCode 远程连接 Ubuntu 服务器,在 Ubuntu 上直接打开代码、编译、运行和调试
这里我们只关注开发调试链路,Git 先不管。这其实就是 VSCode 的远程开发模式,最常用的是。F5这样最稳,因为开发环境、运行环境、调试环境完全一致。如果能登录 Ubuntu,说明第一步没问题。安装后,VSCode 就能把“编辑器界面”放在 Windows,把“工作目录、终端、调试器”放到 Ubuntu。HostHostNameUser配好以后,以后直接连ubuntu-dev就行,不用每次敲整串地址。连接成功后,左下角会出现 SSH 远程标识。这说明现在 VSCode 已经进入“远程开发模式”。
2026-06-23 15:46:32
623
原创 Win10 访问 Ubuntu 里的共享目录配置教程
按你的 Ubuntu 用户名帮你改好。如果你要,我可以继续直接给你一份。如果你想共享别的目录,把。
2026-06-22 14:03:28
250
原创 ACT 纯仿真复现教程(Ubuntu + Conda,无真机ALOHA)
本文提供一套无ALOHA真实机器人、仅依靠MuJoCo仿真环境的ACT完整复现流程,适配Ubuntu服务器/本地台式机,全程使用Conda管理Python环境,覆盖系统依赖安装、仓库部署、仿真数据集生成、模型训练、仿真评估、报错排查全流程,完全基于官方仓库内置仿真任务,新手可一键跟着命令复现。适用场景:实验室远程服务器、无实体机械臂、仅做算法仿真验证、复现ACT论文基线效果。
2026-06-22 13:34:09
563
原创 Windows 端 Codex CLI 安装与 CC-Switch 中转站配置完整教程|免代理本地调用 GPT-5.5
通过 Node.js + Codex CLI + CC-Switch 本地路由的组合,即可在 Windows 环境下低成本搭建 AI 编码辅助环境,无需官方订阅账号、无需全局代理,即可使用 GPT-5.5 等大模型完成代码生成、项目重构、报错排查等工作。配合 VS Code 远程开发能力,还可进一步对接服务器算法项目,大幅提升开发效率。
2026-06-22 10:16:01
1453
原创 VS Code 完整安装与远程开发实战教程(Windows + Ubuntu 服务器 + Codex + RT1 环境部署)
本文完整覆盖了 VS Code 从本地安装、远程服务器连接、AI 编码插件配置,到工业级算法环境部署的全流程。本地轻量编辑,算力全部下沉到服务器,兼顾开发体验与计算性能Codex 本地生成代码,API 密钥不上传服务器,降低数据安全风险Remote-SSH 无缝衔接文件、终端、调试,一体化开发效率更高。
2026-06-22 09:51:45
574
原创 周志华《Machine Learning》学习笔记--第十六章--强化学习
学习范式核心数据学习目标趣味生活化案例通俗解释监督学习带标签的样本(输入+标准答案)学习输入到输出的映射做课后习题,对照答案订正照着标准答案模仿学习无监督学习无标签纯样本挖掘数据内在结构/分布把一堆水果按外形、大小分类没人指导,自己找规律分组强化学习环境交互产生的奖励信号学习最优动作策略,最大化长期奖励训练小狗握手:做对给零食,做错不理和环境互动,靠奖惩不断试错优化专业备注:强化学习的核心主体分为智能体(Agent)和环境(Environment)。
2026-06-11 09:56:54
483
SRCNN的Pytorch代码,可以完整复现,包含数据集
2026-01-10
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅