- 博客(84)
- 收藏
- 关注
原创 视觉 - 语言 - 动作(VLA)模型架构深度报告:链式拆分对齐(V-L-A)vs. 多模态直接融合(V+L-A)
文章摘要: 视觉-语言-动作(VLA)模型是具身智能的核心技术,其架构分为链式拆分对齐(V-L-A)与多模态直接融合(V+L-A)两类。V-L-A通过串行流程分阶段处理视觉、语言和动作,保留了语言中间表征,利于调试但存在信息损耗和计算冗余;V+L-A则通过统一隐空间并行融合多模态特征,直接生成动作,显著提升了参数效率(如TurboVLA参数量仅为传统模型的6%)和推理速度(延迟降低至31.2ms)。
2026-08-06 15:55:33
335
原创 RECAP 强化学习研究报告:原理、应用、对比与未来趋势
RECAP是2025年由Physical Intelligence团队提出的新型强化学习框架,专为机器人控制等真实世界复杂任务设计。其核心创新在于将强化学习转化为优势条件化监督学习模式,通过多源数据(专家示范、自主尝试、人工纠错)和离线迭代训练,解决了传统RL在真实场景中的三大痛点:稀疏奖励、仿真偏差和训练不稳定。
2026-07-29 09:11:33
315
原创 大模型序列生成:Token-level 与 Seq-level RL 原理与对比
本文对比分析了序列生成类强化学习中token-level和seq-level两种奖励策略的差异。token-level RL在每个生成步骤提供即时奖励,奖励信号稠密、训练稳定但易短视;seq-level RL仅在序列完成后提供全局奖励,更符合实际评价逻辑但面临信用分配难题。实际应用中常采用混合策略(如RLHF结合全局RM评分和逐token KL惩罚),并通过奖励塑形等技术平衡二者的优势。两种方法在奖励粒度、信号密度、适用场景等方面存在显著差异,需根据任务特性选择或组合使用。
2026-07-28 08:57:38
333
原创 A100作为深度学习基础计算节点的原因
NVIDIA A100基于安培架构,是深度学习领域的标杆级计算节点,通过全链路优化实现从训练到推理的全场景覆盖。其第三代TensorCore支持多种精度计算,80GB HBM2e显存解决大模型访存瓶颈,NVLink3.0和NVSwitch技术支撑高效分布式训练。MIG技术提升资源利用率,CUDA生态确保工业级兼容性。A100在计算、存储、互联等维度均针对深度学习优化,成为行业通用基础计算单元。与V100和H100相比,A100在算力、带宽和扩展性方面表现均衡,是大模型时代的核心硬件选择。
2026-07-14 16:34:28
442
原创 强化学习中PG_loss的含义
策略梯度损失(pg_loss)是强化学习中优化策略网络的核心函数,通过梯度下降将最大化期望奖励转化为可优化目标。其本质是调整动作概率:正回报动作提升概率,负回报动作降低概率。常见变体包括带基线的REINFORCE(降低方差)、Actor-Critic(使用优势函数)和PPO(引入概率比裁剪)。在Actor-Critic框架中,pg_loss与value_loss(评估价值)共同构成总损失函数。不同实现可能符号相反(梯度下降/上升),但核心逻辑一致。
2026-07-14 09:06:12
346
原创 深入解析 veRL(HybridFlow):重新定义大模型强化学习训练的系统架构
本文将从系统设计原理、核心技术创新、代码架构实现三个维度,对 veRL 与 HybridFlow 进行深度技术拆解,帮助读者全面理解这一前沿 RLHF 训练框架的内在机制。
2026-07-08 17:59:33
446
原创 黎曼流形在具身智能中的应用
黎曼流形为具身智能提供了一种统一的理论框架,能够有效建模机器人状态、构型和观测空间中的非线性几何约束(如刚体姿态、关节运动范围等)。该技术通过将物理约束嵌入流形度量张量,将运动规划、控制和姿态估计等问题转化为流形上的测地线或梯度流优化问题,避免了传统欧氏空间方法中约束与优化割裂的弊端。
2026-07-05 10:50:13
439
原创 DSpark 论文深度解读:基于半自回归生成与置信度调度的投机解码推理加速框架
DeepSeek推出的DSpark是一种高效的大模型投机解码(Speculative Decoding)推理加速框架,旨在解决自回归生成推理效率低下的问题。传统投机解码方案存在生成质量瓶颈(如并行草稿器的多模态冲突)和系统效率瓶颈(固定验证长度导致算力浪费)。DSpark通过半自回归生成架构(并行骨干+轻量串行校正头)提升草稿质量,结合置信度调度验证机制动态调整验证长度,优化GPU资源分配。
2026-07-03 10:14:08
472
原创 深度学习模型:量化与蒸馏
本文系统介绍了深度学习模型轻量化的两大核心技术:模型量化与知识蒸馏,并提供了PyTorch实战代码。模型量化通过降低参数精度(如FP32转INT8)实现无损压缩,推理速度提升1.5-3倍;知识蒸馏通过"大教小"迁移知识,提升小模型精度。二者组合使用时,先蒸馏优化精度再量化加速推理,形成工业级解决方案。文章包含量化/蒸馏的核心原理对比、独立实现代码(后训练量化和软标签蒸馏)以及组合应用实例,最终实现模型体积缩小8倍、推理速度显著提升的效果,特别适合移动端等低资源场景部署。
2026-07-02 14:01:52
179
原创 大模型分布式训练框架深度解析:Megatron-LM、DeepSpeed 与 LLaMA-Factory 的协同架构与并行实践
本文系统分析了大模型分布式训练的三大主流框架:Megatron-LM、DeepSpeed和LLaMA-Factory的技术特点与适用场景。Megatron-LM作为英伟达原生并行引擎,在超大规模模型训练中展现极致性能;DeepSpeed以ZeRO优化技术为核心,显著降低显存占用,成为RLHF训练的首选方案;LLaMA-Factory则通过封装HuggingFace生态,提供开箱即用的微调体验。
2026-07-01 15:19:51
425
原创 VLA 自动驾驶模型开源版本 PyTorch 代码逐模块拆解讲解:聚焦非自回归 Encoder-Decoder 范式
本文深入解析了视觉-语言-动作(VLA)模型在自动驾驶中的应用,重点探讨了非自回归Encoder-Decoder范式的技术实现与优势。文章系统拆解了VLA模型的整体架构,包括多模态编码器、混合解码器和动作精细化校准模块的核心设计,详细分析了从传感器输入到轨迹输出的全链路数据流转。
2026-06-26 08:29:24
350
原创 深度解析强化学习核心算法 PPO:原理与 PyTorch 代码
PPO算法:强化学习的工业级解决方案 PPO(近端策略优化)算法通过引入“信任区域”思想,解决了传统策略梯度算法因更新步长过大导致的训练不稳定问题。PPO的核心创新在于使用截断机制(Clipping)或自适应KL散度约束策略更新幅度,仅需一阶优化即可实现稳定训练,平衡了样本效率与实现复杂度。其Actor-Critic架构结合策略网络和价值网络,通过广义优势估计(GAE)计算优势函数,指导策略优化。PPO广泛应用于机器人控制、游戏AI及大模型对齐(RLHF)等领域,成为强化学习的主流工业方案
2026-06-23 15:10:36
374
原创 联合嵌入预测架构(JEPA)
JEPA(联合嵌入预测架构)是Yann LeCun提出的一种新型自监督学习范式,其核心思想是在抽象表征空间而非输入空间进行预测。该架构由上下文编码器、目标编码器和预测器组成,通过掩码策略和非对称设计学习数据的内在结构。相比生成式和对比学习方法,JEPA具有计算效率高、语义抽象性强和模态通用性好等优势,已在图像、视频、音频等多领域验证有效性。作为构建世界模型的基础架构,JEPA展现了在自动驾驶、机器人等场景的应用潜力,但也面临表征坍缩等挑战。
2026-06-22 16:59:18
446
原创 线性 RNN 并行计算原理详解
线性RNN实现并行计算的核心在于其线性递推关系满足结合律,从而能够通过并行扫描算法将串行计算深度压缩至对数级别。线性RNN的纯线性状态转移特性使其能够定义满足结合律的复合算子,而传统非线性RNN因包含激活函数无法实现。并行扫描分两个阶段:向上规约阶段自底向上合并子段操作元,向下传播阶段计算各位置前缀结果。该方法在GPU上可显著加速训练(尤其长序列场景),同时保持推理时的串行效率。这种架构已应用于Mamba、RWKV等主流长序列模型,成为替代Transformer的重要方案之一。
2026-06-12 21:52:21
427
原创 大模型核心注意力机制技术深度报告:MHA、MQA、GQA 与 MLA 技术原理、性能对比与场景适配
本文系统分析了大模型推理中注意力机制的技术演进路线,聚焦KVCache显存瓶颈问题。从标准多头注意力(MHA)到多查询注意力(MQA)、分组查询注意力(GQA)和最新的多头潜在注意力(MLA),四种方案在模型质量、显存占用和推理速度三个维度呈现不同权衡:MHA保持无损质量但资源效率最低;MQA实现极致压缩但质量损失明显;GQA在8分组时找到平衡点;MLA通过低秩联合压缩在长序列场景展现出压倒性优势。
2026-06-12 21:36:50
396
原创 【DriveGen 文件详解】04——evaluate.py
其评估脚本evaluate.py通过计算FID(Frechet Inception Distance)分数量化生成视频质量,包含特征提取、分布建模和距离计算三大模块。脚本采用轻量级CNN作为特征提取器,支持批处理优化和数值稳定性处理,可自动生成包含FID分数、样本数等指标的评估报告。虽然使用简化特征提取器(非标准InceptionV3),但该方案便于部署且保持评估流程完整性,用户也可扩展InceptionV3等更精确的评估指标。
2026-06-03 22:30:08
384
原创 Diffusion Transformer(DiT):原理、与 U-Net 对比及在视频生成中的深度应用
本文面向 AI 研究人员与工程师,将从技术原理、架构对比、视频生成适配逻辑及工程实现四个维度展开深度解析:首先拆解 DiT 的核心设计逻辑,接着通过量化指标论证其替代 U-Net 的底层依据,再系统讲解 DiT 适配视频生成的架构改造方案,最后提供基于 PyTorch 框架的完整可复用代码示例,覆盖图像、视频生成的核心模块实现。
2026-05-31 21:46:51
937
原创 【DriveGen 文件详解】03——inference.py
其核心功能包括DDPM迭代去噪采样、Classifier-Free Guidance增强生成质量,支持STDiT和SimpleUNet两种模型架构。项目提供完整的推理流程,从参数解析、模型加载到条件帧生成和视频输出,支持多种格式(MP4、GIF、单帧图片等)。关键技术参数包括推理步数(100-500步)、CFG缩放因子(3.0-7.0)和随机种子控制。该工具通过生成高质量驾驶场景视频,有效解决了真实数据采集成本高的问题,特别适用于生成极端天气等稀有场景数据。
2026-05-18 16:33:17
422
原创 【DriveGen 文件详解】02——train.py
本文档详细介绍了DriveGen项目的核心训练脚本train.py,这是一个基于扩散模型的驾驶场景视频生成训练系统。脚本实现了完整的条件视频扩散训练流程,支持STDiT和SimpleUNet两种模型架构,具有参数解析、噪声调度、训练循环、检查点管理等核心功能模块。
2026-05-17 16:13:15
469
原创 【DriveGen 文件详解】01——default.yaml
default.yaml配置文件详细定义了模型参数(如192维隐藏层、6层Transformer)、数据设置(支持合成数据和nuScenes数据集)、训练超参数(50个epoch、1e-4学习率)以及噪声调度(1000步线性扩散)等关键参数。该系统旨在为自动驾驶算法提供虚拟训练数据,特别针对极端天气等稀有场景的数据生成需求。
2026-05-16 20:52:44
394
原创 DriveGen: 基于扩散 Transformer 的驾驶场景视频生成器
DriveGen是一个基于STDiT(时空扩散Transformer)的驾驶场景视频生成器,旨在解决自动驾驶稀有场景数据不足的问题。该项目通过扩散模型生成高质量的虚拟驾驶场景视频,为自动驾驶算法提供极端天气、突发事故等罕见场景的训练数据。项目提供完整的训练、推理和评估流程,支持合成数据和真实数据集(如nuScenes)的适配,具有开箱即用、CPU友好等特点,为自动驾驶数据增强提供了高效解决方案。
2026-05-16 20:41:50
471
原创 DeepSeek V4 大模型技术评估
DeepSeek V4是2026年发布的开源大语言模型,具备三大技术突破:1)混合注意力系统(CSA+HCA)将百万级上下文处理成本降低70%;2)流形约束超连接(mHC)解决万亿参数稳定性问题;3)Muon优化器提升40%训练效率。模型提供1.6万亿参数的Pro版和2840亿参数的Flash版,均支持100万token上下文,在长文本、代码等场景性能媲美顶级闭源模型。采用MIT协议完全开源,支持国产算力适配,显著降低企业私有化部署门槛。
2026-05-01 14:22:59
1436
原创 自动驾驶泊车全面解析
自动驾驶泊车技术发展迅速,从基础辅助到全无人泊车,逐步解决停车难题。核心技术包括多传感器融合感知、智能算法决策和精准线控执行,实现车位识别、路径规划和泊车动作。主流技术分为APA、F-APA、RPA、HPA和AVP五个等级,覆盖不同场景需求。国产车型凭借全栈自研优势在高阶泊车技术上领先。未来将向全场景适配、车路协同、低成本普及方向发展,成为智能出行生态的重要组成部分。
2026-04-27 22:46:06
832
原创 Harness Engineering 技术原理与应用全面解析
典型Harness系统包含四大模块:环境隔离沙箱、工具链封装、反馈自愈循环和可观测性管控。OpenAI的百万行代码实验证明,3人团队借助该范式可在5个月内完成传统30人团队的工作量,效率提升10倍。与传统软件工程相比,HarnessEngineering将人类角色从"编码者"转变为"环境设计师",通过AGENTS.md等活文档实现知识传承,并建立了"错误→规则"的自我进化机制。当前LangChain、DeerFlow等框架已形成丰富工具生态,预示着AI工程化新时代的到来。
2026-04-07 20:51:37
819
原创 基于 VLA 的自动驾驶轨迹规划:从思路到落地的实践之路
摘要:本文介绍了一个基于VLA(矢量化车道注意力)的自动驾驶轨迹规划开源项目。该项目通过矢量形式表征车道元素,利用注意力机制捕捉车道与轨迹的空间关联,解决了传统方法丢失车道矢量信息的问题。系统包含数据预处理、VLA核心模块和轨迹生成优化三大模块,支持多数据集适配,实验显示在NuScenes和Argoverse2数据集上轨迹误差降低15%,规划耗时仅20ms。作者分享了开发中的优化经验,并规划了多智能体交互、端到端部署等未来方向。项目代码已开源,旨在推动更安全高效的自动驾驶轨迹规划技术发展。(150字)
2026-03-30 19:47:09
476
1
原创 MCP(Model Context Protocol)应用案例解析
ModelContextProtocol(MCP)作为AI模型与外部工具交互的标准化协议,自2024年提出以来快速发展。其采用三层架构设计,通过工具、资源、提示三大原语实现智能体与外部系统的高效交互。在电商、金融、医疗等行业应用中成效显著。
2026-03-19 22:19:04
1166
原创 从零开始构建一个编码智能体
摘要:本文系统介绍了基于ReAct机制的Python编码智能体构建方法,从架构设计到核心功能实现。智能体通过"思考-行动-观察"闭环,支持代码补全、算法实现、错误调试、代码优化和文档生成五大功能。关键技术包括多智能体协作架构、沙箱环境集成、IDE适配和提示词优化,重点解决模型幻觉、执行安全和性能优化等挑战。该方案可显著提升开发效率,实现从需求分析到部署的全流程智能化支持。
2026-03-15 16:23:45
471
原创 AI 提示词工程深度探究:基于 Claude 的技术原理、实战技巧与发展趋势
AI提示词工程正从技术探索走向工程实践、从单一模态走向多模态融合、从手工优化走向智能自动化,Claude作为引领者为其发展指明方向,其先进架构、标准化实践方法在各领域展现出巨大应用价值,对于AI开发者而言,需加强技术能力建设、积累实践经验、做好职业规划,才能在技术浪潮中把握机遇、实现成长,共同推动提示词工程技术进步,创造更智能高效的未来。
2026-03-13 22:36:33
863
原创 Prompt, Agent, MCP交互关系
摘要:本文基于B站科普视频,系统解析人工智能领域的三大核心概念:Prompt(提示词)作为用户与AI的交互指令,是需求传递的基础;Agent(智能体)作为任务调度中枢,具备自主决策和执行能力;MCP(模型上下文协议)则是标准化通信协议,保障AI组件间的协作。三者形成"交互层-处理层-通信层"的协作体系,共同支撑AI从被动问答向主动完成复杂任务的进化。研究表明,理解这些概念的定位与协作逻辑,是掌握AI智能体技术的关键基础,后续需结合实践深化应用能力。
2026-03-11 21:57:27
556
原创 AI提示词工程:深入探究
摘要:提示工程是优化AI模型输出的关键技术,通过设计精准提示指导模型理解用户意图。核心要素包括提示格式、上下文示例、微调迭代和多轮对话设计,可提升输出准确性并降低偏见风险。基础提示类型涵盖直接提示、少样本提示和思维链提示等,适用于文本生成、问答、代码开发等场景。高级技术如思维树、检索增强生成等可处理复杂任务。最佳实践建议明确输出格式、版本管理、持续测试和业务协同,确保提示工程的有效性和可维护性。
2026-03-09 22:05:45
461
原创 What is LLM ?
本文系统介绍了大语言模型(LLM)的核心技术与应用。首先阐述了LLM的定义、发展历程及技术基础,重点解析了Transformer架构的自注意力机制。随后详细讲解了LLM的完整训练流程,包括数据预处理、预训练、微调和对齐等关键环节。文章还探讨了高效微调、检索增强生成等优化技术,并分析了LLM在内容创作、智能问答等领域的应用价值。最后指出当前LLM面临的幻觉、可解释性等挑战,展望了多模态融合、智能体化等未来发展趋势。全文构建了LLM从理论到实践的完整知识框架,为相关学习提供了系统性指导。
2026-03-08 16:32:02
406
原创 C++容器的插入和删除操作
本文对比分析了C++标准库中不同容器的插入/删除操作。序列式容器(vector、deque、list等)使用push_back/pop_back操作尾部元素,符合顺序存储特性;容器适配器(stack、queue等)采用push/pop统一接口,隐藏底层实现细节;关联式容器(set、map等)则使用insert/erase进行元素操作,因其无固定顺序。关键在于理解容器结构特性:序列式容器操作尾部,适配器提供逻辑接口,关联式容器采用键值操作方式。
2026-03-08 09:28:28
236
原创 波特图和奈奎斯特图
本文系统介绍了频域分析中的波特图和奈奎斯特图。首先阐述了频域分析的理论基础,包括拉普拉斯变换和傅里叶变换的数学原理。其次详细讲解了波特图的绘制方法、渐近线近似技巧以及稳定性裕度的确定,重点分析了典型环节的特征和系统参数提取方法。然后深入探讨了奈奎斯特图的绘制规则、稳定性判据及其在特殊系统中的应用。最后比较了两者的数学联系与互补性,指出波特图适合系统设计和参数优化,而奈奎斯特图更适用于复杂系统分析和稳定性验证。两种方法各有优势,在实际工程中常需结合使用,为控制系统分析和设计提供全面视角。
2026-03-05 20:24:16
699
原创 汽车VLA技术全解析:从原理到应用,再到未来趋势
本文全面解析汽车 VLA(视觉 - 语言 - 动作)技术,涵盖其概念、架构、与传统技术的优势,深入拆解工作原理,分析在乘用车、商用车等车型的应用,阐述其带来的性能与体验提升,并展望技术演进、融合趋势及市场前景,助力快速掌握 VLA 核心知识点。
2026-02-27 22:07:52
1473
原创 详解文件与文件夹权限:谁能操作、能做什么
日常使用电脑、做服务器运维,甚至是团队共享文件时,你有没有遇到过这些困惑?——“明明是自己建的文件夹,同事却打不开”“点击文件提示‘权限不足,无法访问’”“误删了重要文件,事后才发现任何人都能删除”。这些问题,本质上都是「文件/文件夹权限」没设置对。权限就像文件的“门禁卡”,决定了谁能看、谁能改、谁能删,是保障文件安全、规范多用户协作的核心。不管你是普通电脑用户,还是刚接触运维的新手,今天这篇博客,一次性把权限讲清楚、讲透彻,看完直接能上手操作。
2026-02-20 21:03:14
1251
原创 ADCU (ADAS域控制器)技术解析与应用展望
系统解析了智能驾驶核心部件 ADCU(ADAS 域控制器)。从定义与定位出发,深入其硬件架构与软件体系,阐述了环境感知、智能决策、控制执行及安全保障四大核心功能。展示了其在乘用车、商用车领域的应用及行业格局,并展望了算力升级、舱驾融合、国产化等未来发展趋势,凸显了 ADCU 在智能驾驶产业中的关键价值
2026-02-20 18:04:32
1291
原创 当 Vibe Coding 遇上汽车 PID 开发:AIGC 重构嵌入式创意落地范式
AIGC不是简单的 “代码生成工具”,而是让开发者从 “代码的执行者” 彻底回归为 “创意的设计者”,重构了嵌入式开发的创作逻辑。
2026-02-16 12:59:37
1275
原创 深度解析Vibe Coding:AI时代的编程新范式,让创意无需被代码束缚
本文将从Vibe Coding的起源、核心定义、本质逻辑出发,详细拆解它的核心特征、优势价值、实操方法、工具生态,结合不同人群的应用场景和真实案例,带大家全面了解Vibe Coding的魅力,最后推荐一款最适配Vibe Coding场景的字节跳动AI助手TRAE,帮你快速解锁沉浸式编程新体验,让每一个创意都能轻松落地。兼顾专业性与通俗性,适合开发者、编程新手、互联网从业者,以及所有有“创意落地”需求的人阅读。
2026-02-15 10:10:53
2798
原创 ClaudeSkills是什么
ClaudeSkills 是 Claude/Cursor 系列AI工具的「技能扩展插件体系」,本质可理解为一个「AI技能商店」,通过加载各类专业技能插件,让Claude在特定场景下的能力大幅提升,实现更高效、更专业的任务自动化处理,无需额外复杂操作,即可让AI具备文档处理、前端开发、品牌设计等多样化专业能力。
2026-02-09 22:03:44
838
原创 VMware虚拟机部署Apollo全攻略:从环境搭建到数据包播放(小白避坑指南)
作为自动驾驶领域的开源标杆,Apollo 的环境部署一直是新手入门的 “第一道坎”。本文基于 VMware 虚拟机 + Ubuntu 系统,详细记录从环境准备到数据包成功播放的完整流程,汇总了部署过程中遇到的 Docker 权限、端口映射、浏览器渲染、数据包下载等核心问题及解决方案,帮助新人少走弯路,快速上手 Apollo 开发。
2026-02-08 22:37:42
171
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅