自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(4)
  • 收藏
  • 关注

原创 # 【纯新手向】我的深度学习打怪升级之路(七):让 Transformer 学会“看”——ViT 与视觉大模型入门

上篇我们学 Transformer 时,它的输入是「一个句子 = 一串单词」,每个词对应一个向量。这个套路对文本天然适用。但图像怎么办?图像是一个三维矩阵(宽 × 高 × 通道),没法直接喂给 Transformer。怎么把一张图片变成 Transformer 能消化的「一串向量」?把图切成小方块,每个方块当成一个“单词”。这就是 ViT 的核心思想。听起来简单,但 2020 年 Google 提出时,效果直接对标甚至超越了当时的 SOTA CNN。

2026-06-12 11:11:17 313

原创 【纯新手向】我的深度学习打怪升级之路(四):Transformer——让机器“读懂”上下文的注意力奇迹

2017 年,Google 发表了一篇论文《Attention Is All You Need》,论文的标题言简意赅——你只需要注意力机制就够了。这篇论文提出的 Transformer 架构,彻底改变了 NLP(自然语言处理)领域的格局。在 Transformer 之前,处理序列数据(比如一句话)主要靠RNN/LSTM。它们的问题是什么?一个字一个字串行处理,不能并行计算,速度慢;而且句子一长,前后的依赖关系就容易丢失。抛弃了 RNN 的循环结构,完全靠注意力机制来处理序列。

2026-05-31 12:45:20 328

原创 【纯新手向】我的深度学习打怪升级之路(三):让机器“看见”世界的CNN与视觉应用

如果说上一周的 BP 算法是神经网络的引擎,那么这周的 CNN 就是神经网络的眼睛。理解了卷积和池化的底层逻辑,就能明白为什么深度学习在视觉领域能取得如此惊人的突破。

2026-05-25 09:33:02 28

原创 我的深度学习打怪升级之路(一):逃离base陷阱与揭秘BP算法

正向把数据算过去得出误差,反向利用链式法则把误差传回来求出梯度,最后用梯度下降法更新参数。

2026-05-16 17:20:22 545 1

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除