- 博客(4)
- 收藏
- 关注
原创 # 【纯新手向】我的深度学习打怪升级之路(七):让 Transformer 学会“看”——ViT 与视觉大模型入门
上篇我们学 Transformer 时,它的输入是「一个句子 = 一串单词」,每个词对应一个向量。这个套路对文本天然适用。但图像怎么办?图像是一个三维矩阵(宽 × 高 × 通道),没法直接喂给 Transformer。怎么把一张图片变成 Transformer 能消化的「一串向量」?把图切成小方块,每个方块当成一个“单词”。这就是 ViT 的核心思想。听起来简单,但 2020 年 Google 提出时,效果直接对标甚至超越了当时的 SOTA CNN。
2026-06-12 11:11:17
313
原创 【纯新手向】我的深度学习打怪升级之路(四):Transformer——让机器“读懂”上下文的注意力奇迹
2017 年,Google 发表了一篇论文《Attention Is All You Need》,论文的标题言简意赅——你只需要注意力机制就够了。这篇论文提出的 Transformer 架构,彻底改变了 NLP(自然语言处理)领域的格局。在 Transformer 之前,处理序列数据(比如一句话)主要靠RNN/LSTM。它们的问题是什么?一个字一个字串行处理,不能并行计算,速度慢;而且句子一长,前后的依赖关系就容易丢失。抛弃了 RNN 的循环结构,完全靠注意力机制来处理序列。
2026-05-31 12:45:20
328
原创 【纯新手向】我的深度学习打怪升级之路(三):让机器“看见”世界的CNN与视觉应用
如果说上一周的 BP 算法是神经网络的引擎,那么这周的 CNN 就是神经网络的眼睛。理解了卷积和池化的底层逻辑,就能明白为什么深度学习在视觉领域能取得如此惊人的突破。
2026-05-25 09:33:02
28
原创 我的深度学习打怪升级之路(一):逃离base陷阱与揭秘BP算法
正向把数据算过去得出误差,反向利用链式法则把误差传回来求出梯度,最后用梯度下降法更新参数。
2026-05-16 17:20:22
545
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅