- 博客(4)
- 收藏
- 关注
原创 神经网络与深度学习课程总结(四)
本文系统梳理了计算机视觉从传统单模态模型向多模态大模型的技术演进路线。首先概述了技术发展的三个阶段:传统视觉模型的单模态局限、多模态联合表征的兴起,以及视觉架构向Transformer的收敛趋势。随后重点解析了Vision Transformer(ViT)的核心架构,包括图像分块嵌入、位置编码、编码器结构及下游任务适配策略。文章还对比了CLIP和DINO两种典型视觉表征方案:CLIP通过对比学习实现图文跨模态对齐,支持零样本分类;DINO则采用无监督自蒸馏框架,擅长密集特征表征。最后探讨了ViT的计算复杂度
2026-06-08 01:16:19
368
原创 神经网络与深度学习课程总结(三)
本文系统介绍了Transformer模型的架构原理与核心机制。Transformer通过完全基于自注意力机制的设计,克服了传统RNN/CNN在长距离语义关联和并行计算方面的局限性。其核心架构包含输入处理、编码器堆叠、解码器堆叠和输出预测四个模块,采用正弦位置编码和多头注意力机制有效捕捉序列关系。文章详细阐述了自注意力的计算步骤、多头机制的作用原理,以及编码器-解码器的交互方式。实验表明,Transformer在机器翻译任务中显著优于同期模型,奠定了现代大模型的基础架构。该设计具有强大的可扩展性,可直接迁移应
2026-06-01 09:19:27
357
原创 神经网络与深度学习课程总结(二)
本文总结了计算机视觉领域的常用数据集、评价指标以及目标检测与语义分割技术。常用数据集包括MNIST、Fashion-MNIST、CIFAR-10、PASCAL VOC、MS COCO和ImageNet,涵盖不同难度和应用场景。评价指标部分介绍了混淆矩阵、精确率、召回率、P-R曲线、AP和mAP等核心度量。目标检测部分梳理了从R-CNN到YOLO的发展历程,分析各算法的创新点和优缺点。语义分割部分简要介绍了FCN和DeepLab v3等典型方法。全文为计算机视觉研究提供了基础数据资源和算法评估的参考框架。
2026-05-25 09:57:07
331
原创 神经网络与深度学习课程总结(一)
本文总结了神经网络与深度学习的演进历程和核心概念。从1943年M-P模型到2012年AlexNet的突破,深度学习经历了多次复兴。核心内容包括:1)线性模型到感知机的演进,通过激活函数解决非线性问题;2)多层前馈网络与BP算法,利用链式法则实现误差反向传播;3)CNN的创新设计,包括局部连接、权值共享和池化层;4)经典架构分析,如LeNet-5、AlexNet、VGG-16和ResNet,重点阐述了残差连接解决梯度消失问题的机制。这些发展为现代深度学习奠定了基础。
2026-05-17 23:49:56
576
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅