自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(37)
  • 问答 (1)
  • 收藏
  • 关注

原创 Week01 学习笔记:让 LLM 自动化你的科研工程工作

🍨 本文为🔗365天深度学习训练营中的学习记录博客🍖 原作者:K同学啊。

2026-08-07 21:13:01 196

原创 基于LSTM的医疗成本预测

本节不止学了LSTM网络的运用,还学习了数据可视化处理的常用方法数据集介绍:本文采用的数据集为公开的医用费用预测数据集,在采集患者年龄与年度医疗费用的基础上,还采集了以下20种特征:agegenderbmismokerdiabetesasthmacity_type有一个叫Seaborn的库,集成了很多可以直接用的常用的高级绘图LSTM的预测用的是R2而不是acc关键区别R2:衡量连续数值预测的拟合程度,越接近 1 越好。accuracy。

2026-06-18 16:47:01 205

原创 基于 RNN 的心脏病预测

本次使用的数据集是心脏病预测数据集,文件名为heart.csv。数据集共有 303 条样本,每条样本包含 13 个特征和 1 个标签。age:年龄sex:性别cp:胸痛类型trestbps:静息血压chol:血清胆固醇fbs:空腹血糖restecg:静息心电图结果thalach:最大心率exang:运动诱发心绞痛oldpeak:ST段下降值slope:ST段斜率ca:主要血管数量thal:地中海贫血类型target:是否可能患心脏病其中target0:不会患心脏病。

2026-06-12 23:16:41 272 5

原创 ResNeXt-50——学习记录

ResNet-v2:通过前向反馈(Identity Mapping)解决了深层网络的梯度消失问题。Inception 系列:通过并行多路径(Split-Transform-Merge)增加了网络的宽度,捕获多尺度特征。DenseNet:通过特征复用(Feature Reuse)把通道利用到了极致。但是,这些网络都有各自的痛点。Inception 虽好,但它的子网络结构太复杂了;而 ResNet 虽然简单好堆叠,但一味地加深或加宽,边际效益会严重递减。

2026-06-04 15:02:29 203

原创 InceptionV3——学习记录

上周我们学习了 Inception V1(GoogLeNet),了解了 Inception 模块"多分支并行卷积"的核心思想,这周我们学习Inception V3。问题具体表现大卷积核计算量大V1 中仍在使用 5×5 卷积,参数多、FLOPs 高,限制了网络继续做深做宽表征瓶颈(Representational Bottleneck)如果特征图的尺寸(尤其是通道数)在某一层被过于激进地压缩,会造成信息丢失特征图降采样不优雅先 Pooling 再 Inception 会丢信息;

2026-05-28 16:15:21 399

原创 Inception V1——学习记录

本节我们学习了Inception V1相关内容,特别是其中的卷积层并行结构和1*1卷积核的部分。InceptionV1的卷积层并行结构打破了传统CNN串行堆叠的单一模式,通过在同一层内并行布置1×1、3×3、5×5卷积和池化分支,实现了多尺度感受野的同步特征提取。这种设计的本质是将尺度选择权交给网络自身——不同尺寸的卷积核分别捕获从局部细节到全局语义的跨尺度信息,最终在通道维度拼接形成融合表征。

2026-05-21 12:41:45 372

原创 SE注意力机制——学习记录

SE全称为Squeeze-and-Excitation Networks(挤压与激发网络),是由胡杰等人于2018年提出的注意力机制,获得了ImageNet 2017冠军。其核心思想是:让网络自动学习每个特征通道的重要性,然后对通道进行加权,增强有用特征、抑制无用特征。从训练结果可以看出,加入了SE模块的网络,比未加入的更快收敛.并且在训练集上达到了更高的准确率.并且测试集最优准确率达到91+(达到训练要求89+)

2026-05-11 19:29:08 446

原创 ResNet与DenseNet的结合探索

这个模型明显加强了抗过拟合的能力,一直到80epochs后训练集准确率和测试集准确率才有明显的分离。虽然收敛的速度慢了,但是更大的参数量让他获得了更可靠的先验数据。根源在于它把 DenseNet 每一层的新特征生成,从“凭空创造”变成了“有历史依据的修正”——通过新增的 1×1 残差映射,网络只需学习当前输入相对旧特征浓缩版的微小偏移量,而不再需要从零开始编造完整的新特征;

2026-05-06 18:10:16 392

原创 DenseNet——Pytorch学习记录

2016年,康奈尔大学、清华大学与Facebook FAIR的研究团队合作提出了DenseNet(Densely Connected Convolutional Networks),论文一举斩获CVPR 2017最佳论文奖。要理解DenseNet的动机,需要先回到我们上一节介绍的ResNet的成功与局限。何恺明在提出ResNet时做了一个关键假设:如果对某一网络中增添一些可以学到恒等映射的层,那么最差的结果也是新网络的这些层在训练后成为恒等映射而不影响原网络性能。

2026-04-28 00:00:00 412

原创 ResNet50V2算法实战记录

本节我们在上一节的基础上将模型换成了V2模型,并讨论了两者之间的区别。最后根据V2模型的结构图成功构造出V2模型,并完成训练。

2026-04-23 14:45:07 209

原创 ResNet-50——pytorch版

这一节我们重新回到了Pytorch环境进行训练,在该环境下可以调用OpenCV等图像处理库。并且了解了ResNet 这个经典的CNN网络结构,并完成了他的搭建与训练。

2026-04-15 14:41:36 421

原创 优化器对比实验--TensorFlow版本

本文主要是探究及对比不同优化器对模型的影响

2026-04-07 16:04:58 390

原创 数据增强——tensorflow

数据增强(Data Augmentation)是指在不改变数据标签的前提下,对原始数据进行各种变换,生成更多样化的训练样本的技术。把一张图片“变着花样”复制出多张——旋转一下、翻转一下、调亮一点……这些都叫数据增强。

2026-04-02 15:37:03 501

原创 猫狗识别2——Tensor flow版

这节的核心任务是找到上一节出现的问题,据我观察,问题发生在这个位置,上一节的trian_loss在里面循环里面进行的初始化,这样子会导致后面的mean没有意义,因为他只有最后的一个值,并不是这一个batch的结果。所以这一节我们将初始化放到了外面,每次append新值并计算mean。

2026-03-25 16:31:59 312

原创 猫狗识别——TensoFlow版本

这次课做的是一个二分类的猫狗识别,有3400张相关的图片,依旧调用的VGG16的模型。由于我电脑可能存在算力不足的问题,故我没有采用自建模型的方式,采取调用官方训练好的VGG16模型不包括头部然后自建连接层但是我看了源代码中自建模型的部分,感觉最后这个调用有问题,因为这是个二分类,他的类别却输入为1000然后讲讲我的调用官方模型的代码与源代码不同的地方,因为我是调用的官方VGG16,故输入的格式需要经过改变,故我import了一个vgg16自带的输入处理函数,通过map(lamba函数)遍历整个数据集。

2026-03-17 14:52:58 225

原创 咖啡豆的四分类任务——Tensorflow版本

本节我们尝试了用自建VGG16去做四种咖啡豆的识别任务,但是效果不佳。最后尝试加入一些手段解决过拟合问题并未成功,问题可能来源于算力显存不足。最后改为调用官方模型以及权重+自建线形层完成训练,效果还是很不错的。

2026-03-11 14:46:35 352

原创 好莱坞明星识别——Tensorflow版本

本节是使用自建模型识别17位好莱坞明星的人脸,数据集采用的是自建小数据集。本节和以往很大的区别就是本节属于多分类问题,所以选用的损失函数为categorical_crossentropy(多分类的对数损失函数)文中还有介绍一种sparse_categorical_crossentropy(稀疏性多分类的对数损失函数),他与ategorical_crossentropy(多分类的对数损失函数)的区别是,sparse适用于整数编码,而categorical适用于one-hot编码。

2026-03-05 16:04:19 394

原创 运动鞋识别——tensorflow版本

current_time = datetime.now() # 获取当前时间plt.xlabel(current_time) # 打卡请带上时间戳,否则代码截图无效plt.show()通过plt将结果可视化,可以看出准确率还在逐步提高,但是训练集的loss已经有点趋于平稳了.最后调用最优模型来进行验证# 加载效果最好的模型权重print("预测结果为:",class_names[np.argmax(predictions)])(确实可以先plt显示图片的,我忘记加上了)

2026-02-11 17:25:51 245

原创 猴豆病识别——Tensorflow版

本节主要是继续掌握tensorflow的专属写法,继续熟练掌握训练集测试集的写法,模型调度以及在其中领悟早停机制的魅力。

2026-02-04 17:08:15 419

原创 天气识别——tensorflow版

这一次学了非官方数据集,即自建数据集的处理方式,通过tf.keras.preprocessing.image_dataset_from_directory()函数来处理并生成训练集和测试集还有使用prefetch来加速运行以及后面数据展示的对history(model.fit())的利用。

2026-01-26 20:00:00 642

原创 彩色图片分类——tensorflow版本

tensorflow代码短,很简洁,但是训练的结果一般,很容易就过拟合。epochs设置20以上能看到明显的loss上升趋势,需要接入动态学习率或者早停机制(当然也可能是adam默认的学习率过高)# 多种指定方式optimizer='adam' # 1. 字符串简写(最常用)optimizer='sgd' # 随机梯度下降# 2. 更详细的配置# 3. 自定义优化器adam函数是自带动态学习率的,只不过变化的很慢,我将lr=0.0001(默认为0.001),epochs=45,训练结果就好一些。

2026-01-21 17:03:04 556

原创 实现mnist手写数字识别——tensorflow版

给我的感触就是有点陌生,和pytorch不太一样,但是看起来会更简洁,继续走走看看吧。

2026-01-14 20:07:50 406

原创 Windows系统tensorflow--GPU的环境配置

在这个版本上做了点更新,总结了一下过程。

2026-01-14 14:24:33 327

原创 Pytorch实现车牌识别——学习记录

故我们将文件夹内地址逐个分开存储在list里,后按"\\"分开取里面的最后一位(不要前面的./dataset/car/015_licence_plate)部分,然后再按照"_"分开取第二位,最后按"."分开取第一位计入classNames序列中。在网络中,self.reshape = Reshape([label_name_len, char_set_len])输入为一个[7, 73]的维度,这个是shape,然后x的batch维度保持,将其展为(B,7,73)维度。先构建一个大序列,包含了字,数,英文。

2026-01-08 15:51:42 646

原创 YOLOv5-Backbone模块——学习记录(内附完整代码)

左侧这一块即为backbone模块,他在整体中起到了特征提取的作用,neck层为多元特征融合,prediction层是预测作用。再backbone层中,Conv层和C3层上一篇文章已经介绍过了,这次我们来介绍一下SPPF层。SPPF流程如图所示,先通过一个Conv将输出维度减半,再依次通过三个最大池化层,并保留每次结果进行维度叠加。SPPF层是特征增强模块,通过不同尺度的最大池化核对同一特征图进行并行池化,让网络感知不同尺寸的目标信息。Torchvision版本:0.24.1+cu130。

2025-12-24 14:08:14 308

原创 YOLOv5-C3模块——学习记录

接下来是Bottleneck层,Bottleneck层是现代深度卷积网络的核心组件,主要作用是在保持或提升性能的同时,显著降低计算复杂度和参数量;C3模块由输入先经过一个Conv层,然后加上通过N个bottleneck层的结果,最后再经过一个Conv层组成。如图所示,一个bottleneck层是将输入以及输入经过两次conv层后的输出结合在一起作为输出。可自行选择,增加其中C3层数量,以及bottleneck层数量。首先,定义了一个新卷积Conv,它是由一个卷积层、一个池化层以及一个SiLU层组成。

2025-12-16 14:11:05 445

原创 VGG16识别马铃薯病害——学习记录

VGG-16拥有13个卷积层、3个全连接层和5个池化层由于其包含了16个隐藏层,故称之为VGG-16*图源@K同学啊每个卷积层都是3*3的卷积核,padding=1,并且每个卷积后面都跟着一个ReLU层五个池化层用的都是2*2的核,2的步长进行的两倍压缩然后经过线性展开保留0维(batch),剩下的维度展开后经过三个线形层进行分类linear(4096,3)#最后分为3类,符合classnames。

2025-12-10 13:41:59 268

原创 VGG16实现人脸识别——学习记录

当指标不动时优化学习率,采用max模式(以准确率,F1分数为指标),factor衰减因子,patience耐心值(连续几个epoch没有提升才降)模型训练:optimizer.zero_grad(), loss.backward(), optimizer.step()(梯度下降)数据预处理:transform 数据分割:random_split 数据加载:dataloader。修改了最后一层线性层部分,使其贴合我们的需求,并且让他只修改这一层的数据。CUDA版本:13.0。

2025-12-03 18:20:57 332

原创 运动鞋识别——学习记录

Python版本:3.10.19PyTorch版本:2.9.1+cu130Torchvision版本:0.24.1+cu130CUDA版本:13.0GPU设备:NVIDIA GeForce RTX 5060。

2025-11-27 19:34:19 480

原创 猴豆病识别——学习记录

跟测试集处理相似,要先通过一个transform转化成tensor数据类型,但是关键在于单张图片和batch图片的维度不同,所以要通过一个unsqueeze来扩维,最后通过最高概率的类别来判断是哪一类。还卡,我人麻了,接下来试了加入卷积不加池化层,效果也一般,现在试试啥都不加去掉一个池化层(加入学习率调度和dropout层)动态学习率+dropout的训练卡在86-88之间,感觉得改变层结构了,打算加入多一组卷积层和池化层来试一下。猜测是全连接层的问题,保留dropout层改回全连接层。

2025-11-20 13:09:33 796

原创 附加课:让代码看起来专业一点

然后新建一个文件叫main.py,这样可以直接调参不用找又不会泄露啥的(反正就是看起来很高级。第一:将代码分为,train.py 和 main.py。的两部分,train()中包含原本的代码。最后将预测的代码单独拎出来成为一个文件。单独运行这个文件得到预测结果输出。

2025-11-20 13:08:29 135

原创 用Pytorch实现天气识别——学习记录

识别本地图片的方法跟测试函数应该相似,但是jpg格式是无法直接导入模型的,故先要用transform来使其符合要求,再通过模型,进行argmax判断。该图为网络结构,我们可以看出,该网络由四个卷积层和两个池化层和一个线形层(x.view操作)组成,根据图片设置参数。***核心***:到池化层时我们发现卷积核的大小是2,但是整体尺寸缩小了一倍,代表池化层的步长为2!由于减小后训练变化不大,以为不应该调小学习率,调大了学习率导致准确率和loss直接炸了。Torchvision版本: 0.15.2。

2025-11-08 19:16:08 272

原创 基于CIFAR10的彩色图像识别——学习记录

注:Flatten层并不会改变输入数据的形状,而只是将其展开为一维向量。因此,该层通常作为神经网络的中间层使用,将前面的多维数据转换为一维向量后再进行后续的处理。Flatten层会将输入数据按照顺序展开,得到一个一维向量作为输出,同时保留输入数据中的所有信息,例如空间位置信息、通道信息等。原始的图片是以(C,H,W)的形式存放,为了符合plt.imshow的文件格式将C给移到末尾。相关函数:model.train、model.eval。相关函数:CrossEntropyLoss、SGD、

2025-11-03 17:07:57 814

原创 Pytorch实现mnist手写数字识别

transform是torchvision中的转换工具,常采用totensor来将数据转化为tensor类型,方便后续的处理;Python版本: 3.10.18 | packaged by Anaconda, Inc. | (main, Jun 5 2025, 13:08:55) [MSC v.1929 64 bit (AMD64)]训练5轮,model.train()是训练模式,会启用dropout层并更新均值方差,model.eval()是评估层,关闭dropout层并使用训练时的均值方差。

2025-10-29 13:52:57 722

原创 完整的模型训练套路

数据集采用的CIFAR10,训练集为50000张图片,测试集为10000张图片,从torchvision的官方数据库自动下载,保存在dataset文件夹中,根据需要测试or训练集设定为T/F,为符合后续需要,转化为totensor类型,自动下载。加载tensorboard,使其可视化,将数据记录在logs_train文件中。通过dataloader加载数据集,设置每一batch大小。损失函数选择交叉熵损失,常用于概率问题。优化器选择SGD,学习率设定为0.01。源自bilibili_up_我是土堆。

2025-10-23 20:50:22 189

原创 PyTorch学习记录

跟着小土堆@我是土堆_bilibili的视频学的笔记。tensorboard查看模型。

2025-10-20 20:11:04 118

原创 Python下载实战:核心技巧与高级方案

HTTP GET请求基础实现。

2025-10-20 11:27:30 328

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除