- 博客(4)
- 收藏
- 关注
原创 【无标题】
文章摘要 本周课程重点探讨了视觉大模型与Vision Transformer(ViT)的核心技术及其应用。课程内容涵盖大语言模型基础、多模态学习、ViT架构原理(包括Patch Embedding、位置编码和Transformer Encoder)、CLIP模型的对比学习机制以及知识蒸馏方法。ViT通过将图像分割为Patch并应用自注意力机制,突破了CNN的局部感知局限,实现了全局依赖建模。CLIP模型则通过图文对比学习构建跨模态统一表示。这些技术共同推动了计算机视觉从传统CNN向Transformer架构
2026-06-08 13:26:51
317
原创 HIT神经网络与深度学习课程周总结
本周系统学习了Transformer模型,这是2017年Google提出的革命性序列建模架构。Transformer完全基于注意力机制,摒弃传统RNN/CNN结构,解决了序列模型的并行计算和长距离依赖两大痛点。文章详细解析了Transformer四大模块:输入部分(词嵌入+位置编码)、编码器(多头自注意力+前馈网络)、解码器(掩码自注意力+交叉注意力)和输出模块(线性映射+softmax)。通过数学公式和代码示例,阐述了自注意力机制、残差连接等关键技术原理。Transformer在机器翻译任务上取得突破性性
2026-05-31 19:52:36
365
原创 HIT神经网络与深度学习课程周总结
本文总结了深度学习视觉应用第三周课程内容,重点解析了主流视觉数据集(MNIST、Fashion-MNIST、CIFAR-10、PASCAL VOC2012、MS COCO、ImageNet等)的特点与使用场景,详细介绍了模型评价指标(精确率、召回率、mAP等)的计算原理,并深入讲解了YOLO目标检测算法的核心思想与损失函数构成。课程内容涵盖视觉任务从数据准备到模型评估的全流程,为计算机视觉入门提供了系统性的知识框架。
2026-05-25 01:45:02
371
原创 HIT神经网络与深度学习课程周总结
摘要:本文基于哈工大屈桢深老师的讲义,系统总结了神经网络与深度学习课程的核心内容。课程从人工智能背景入手,介绍了机器学习与数据基础,重点讲解了线性回归、分类及感知机模型,并针对XOR问题引出多层感知机(MLP)解决方案。详细阐述了BP误差反传算法的原理与训练流程,包括前向传播、误差计算和权值更新机制。通过本周学习,掌握了神经网络的基础理论、线性模型到多层网络的演进过程,以及BP算法的核心思想,为后续深度学习实践奠定了理论基础。
2026-05-16 18:21:58
616
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅