自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(5)
  • 收藏
  • 关注

原创 Grounding DINO详解

摘要: GroundingDINO提出了一种三阶段跨模态融合的开放集目标检测框架,通过双编码器-单解码器架构实现视觉与语言的深度对齐。其核心创新包括:(1)在特征层、查询初始化层和解码器层全流程注入语言信息;(2)采用子句子级文本表示方法,通过注意力掩码消除无关类别干扰;(3)基于大规模预训练,在零样本检测、跨域迁移和指代理解三类任务上均达到SOTA性能,COCO零样本AP达52.5。模型采用Swin Transformer和BERT作为双编码器,通过特征增强器实现多尺度视觉-语言交互,语言引导的查询选择机

2026-06-21 15:21:49 376

原创 PPO、DPO和GRPO算法详解

本文对比解析了三种大模型强化学习算法:PPO、DPO和GRPO的核心原理与训练流程。PPO采用四模型架构(Actor、Critic、Reward、Reference),通过近端策略优化实现稳定训练;DPO创新性地绕过奖励建模,直接利用人类偏好数据进行策略优化;GRPO则通过组内对比采样替代价值网络,显著降低计算成本。三者均采用KL散度约束防止模型漂移,但分别代表了奖励建模、直接优化和对比学习三种技术路线,为大规模语言模型对齐提供了多样化的解决方案。

2026-06-13 19:44:36 375

原创 CS336 lecture1

本文介绍了三种文本分词方法:1)字符级分词(按字符切分,计算量大);2)词级分词(按完整词语切分,难以处理罕见词);3)子词级分词(主流方法,包括BPE、WordPiece和SentencePiece)。重点分析了子词分词的三种算法:BPE基于频率合并字符对,WordPiece通过概率得分优化合并,SentencePiece则无需预分词直接处理多语言文本。三种方法各有特点,适用于不同场景,其中子词分词在平衡计算效率和语义表达方面表现最佳。

2026-05-27 16:15:01 344

原创 Transformer 学习笔记

本文系统解析了Transformer架构的核心组件和工作原理。首先介绍了输入层的词嵌入和位置编码机制,重点阐述了旋转位置编码(RoPE)的创新性,通过向量旋转将绝对位置转化为相对位置信息。详细讲解了缩放点积注意力的计算过程,包括Q、K、V矩阵的生成和注意力分数的计算。深入分析了多头注意力机制的分头处理和拼接操作。完整描述了编码器和解码器的结构差异,特别是解码器的掩码多头注意力机制如何防止信息泄露。最后说明了输出层的线性变换和Softmax归一化过程。全文逻辑严密,从输入到输出完整呈现了Transformer

2026-05-21 20:27:08 400

原创 BERT 学习笔记

BERT是Google提出的基于Transformer的双向预训练语言模型。其核心架构包含嵌入层(词嵌入、句段嵌入、位置嵌入)、Transformer编码器(多头注意力机制)和任务适配层。预训练采用掩码语言模型(MLM)和下一句预测(NSP)两个任务:MLM随机遮蔽15%的token进行预测,NSP判断句子关系。模型通过12层编码器将输入转换为768维向量,下游任务可微调输出层处理分类、问答等任务。BERT的创新在于双向上下文建模,通过预训练+微调范式显著提升了NLP任务表现。

2026-05-17 15:59:23 494 1

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除