- 博客(123)
- 资源 (1)
- 收藏
- 关注
原创 5.1 神经元、神经网络的理解
从本质上讲,神经元不过是输入的线性变换(例如,输入乘以一个数[weight,权重],再加上一个常数[偏置,bias]),然后再经过一个固定的非线性函数(称为激活函数)。是激活函数,在此处设置为双曲正切。数学上,你可以将其写为。
2025-07-24 09:33:52
297
原创 4.8 常见的损失函数
损失函数是模型训练的导航仪,其选择直接影响模型性能。理解不同损失函数的数学特性、适用场景及实现细节,是构建高效模型的关键。实际应用中,需结合任务需求、数据分布和模型结构综合权衡。损失函数(Loss Function)是机器学习和深度学习的核心组件,用于。,指导模型参数的优化方向。
2025-07-24 09:29:31
814
原创 4.6 损失函数的正则化
正则化通过约束模型复杂度,是提升泛化能力的核心手段。不同方法各有优劣,需结合数据特性和任务需求选择。合理调节正则化强度(如 λ 或 Dropout 率)是实现模型最优性能的关键步骤。正则化是机器学习中防止模型过拟合的重要技术,通过在损失函数中引入额外的约束项,限制模型复杂度,提升泛化能力。
2025-07-24 09:12:05
1033
原创 4.5 优化器中常见的梯度下降算法
梯度下降算法被严格地数学化,成为深度学习模型优化的基础工具。决定,其本质是沿着损失函数曲面的最速下降方向移动参数。控制步长,过大可能导致震荡,过小则收敛缓慢。梯度下降的更新方向由。
2025-07-24 09:07:42
956
原创 4.4 损失函数对模型参数的梯度
在深度学习和优化问题中,损失函数(Loss Function)对模型参数的梯度, 这是模型训练中最核心的数学概念之一。以下从数学角度逐步解释其含义和作用:
2025-07-24 08:49:10
708
原创 4.3 激活函数的目的
激活函数是神经网络中的核心组件之一,其目的是引入非线性特性,使网络能够学习和表示复杂的模式。通过激活函数的合理选择,神经网络能够灵活地建模复杂数据关系,成为解决实际问题的强大工具。其输出范围为 (0, 1)。对线性输出施加非线性变换。能够拟合任意复杂的函数。缓解梯度消失/爆炸问题。
2025-07-23 15:52:40
761
原创 4.2 从数学的角度解释模型训练的过程
中寻找损失函数的全局最小值(如图)。梯度下降沿最陡下降方向移动,可能陷入局部极小值或鞍点,但通过随机性(如 SGD)和优化器设计可缓解此问题。(如梯度下降)调整模型参数,使得模型的预测结果与真实数据之间的误差(由。其一避免梯度消失和梯度爆炸的情况,其二是引入非线性,拟合更复杂的函数。,其核心是通过迭代调整参数,使模型能够从数据中捕捉潜在规律。通过上述数学框架,模型训练被形式化为一个。对于复杂模型(如神经网络),梯度通过。从数学的角度,模型训练的核心是通过。模型通常表示为一个参数化的函数。
2025-07-23 15:39:10
1112
原创 3.2 时间序列_表格数据 如何转Tenosr张量
将时间序列数据转换为张量(Tensor)的过程主要涉及数据加载、预处理和格式转换。通过以上步骤,你可以将时间序列数据转换为深度学习框架所需的张量格式。在训练模型时,通常需要批次数据。
2025-07-23 15:19:06
358
原创 3.1 文本数据转Tensor
通常,处理文本数据包括几个主要步骤:分词、构建词汇表、将分词后的文本转换为索引序列,然后将这些索引序列转换为张量。不过,中英文的分词方法可能不同,英文通常以空格分隔单词,而中文则需要专门的分词工具,比如结巴分词。这一点需要注意,可能需要不同的处理方式。接下来,关于构建词汇表。无论是中文还是英文,都需要将单词或字符映射到唯一的整数索引。可能需要处理一些特殊情况,比如未知词(UNK)或填充(PAD)。词汇表的大小也是一个考虑因素,可能需要限制词汇量,只保留最常见的词,其余的标记为未知词。
2025-07-23 15:17:30
291
原创 2.5 张量在GPU上操作技巧以及常用的张量api
掌握这些技巧和 API 后,可以高效利用 GPU 加速张量计算,同时避免常见性能陷阱!• 尽量在 GPU 上完成所有计算,减少 CPU 和 GPU 之间的数据传输(例如。会触发显存到内存的拷贝,性能较差)。• 清空缓存:手动释放未使用的显存。• 方法 2:直接使用。(推荐,灵活指定设备)
2025-07-23 15:08:55
478
原创 2.3 张量在内存中的存储形式(storage)以及shape、offset、stride概念介绍
tensor 通过 offset ,shape ,stride 实现 转置、索引等操作
2025-07-23 15:06:03
311
原创 2.1 为什么定义tensor数据结构?
PyTorch的Tensors本质是NumPy数组的扩展与升级,专为深度学习设计,兼具自动求导GPU加速高维数据处理和生态集成四大优势。而NumPy更适用于通用数值计算,在GPU支持和自动求导方面存在短板。因此,PyTorch选择Tensors作为核心数据结构,既满足了深度学习的特殊需求,又保留了与NumPy的兼容性(如互相转换)。
2025-07-23 14:53:47
523
原创 1.3 pytorch & CUDA
首先,虽然“PyTorch”包含“Python”中的"Py",但PyTorch中有很多非Python代码。由于性能原因,大多数PyTorch都是用 C++和 CUDA编 写的,CUDA是NVIDIA提供的类似C++的语言,可以将其编译然后在NVIDIA GPU上大规模并行运行。
2025-07-23 14:53:16
413
原创 1.2 计算图与动态图和静态图机制
了解计算图的静态图或者动态图,首先我们需要了解是及时执行还是延时执行,这里书中了一个例子就是说呢,假如我们输入了两个变量,两个变量之间进行一系列运算关系的操作,直接得出输出,这种方式就是。而延时执行就是我们首先封装了一个函数,因此我们先是已经有相应的函数来表达相应的运算方式后,才输入得到输出,这种方式是。不同深度学习库的一个关键区别在于是 即时执行 还是 延迟执行。如ptyorch 和 tensorflow。衡量计算图是静态方式还是动态方式,一个最重要的标准就是它的计算方式是** 及时执行** 还是。
2025-07-23 14:50:01
209
原创 1.1 Deep learning?pytorch ?深度学习训练出来的模型通常有效但无法解释合理性? 如何 解释?
DL 对于我而言,就是人类试图想通过数学语言描述人类学习过程的一门技术,或者说学科。因此 DL 模型 相当于 数学 的 一个 funciton ,有输入,通过function处理,得到输出。
2025-07-23 14:47:08
524
原创 0.0 深度学习资料网站
基于PyTorch深度学习库的pdf笔记。基于MXNet深度学习库的pdf笔记。课程链接(视频、课件)JuPyter记事本。
2025-07-23 14:46:03
247
原创 Microsoft Visual C++ 14.0 or greater is required. Get it with “Microsoft C++ Build Tools“的解决办法
【代码】Microsoft Visual C++ 14.0 or greater is required. Get it with “Microsoft C++ Build Tools“的解决办法。
2024-03-23 23:00:59
3161
原创 Towards Open Vocabulary Object Detection without Human-provided Bounding Boxes(2021CVPR)----论文阅读笔记
Towards Open Vocabulary Object Detection without Human-provided Bounding Boxes----论文阅读笔记Abstract1. Introduction如何实现? pseudo bounding box label如何生成的?2. Related Work3. Related Work3.1. Generating Pseudo Box Labels3.2. Open vocabulary Object Detection with Ps
2022-01-08 16:04:27
2396
原创 什么是word embedding?
https://easyai.tech/ai-definition/word-embedding/#representation
2022-01-06 19:59:44
575
原创 什么是RPN,ROIAlign?
RPNRPNRPNRPN(Region Proposal Network)用来产生Regin Proposal(前景框,候选区域,检测框(Faster RCNN 直接拿来做检测框)
2022-01-06 15:25:59
2652
原创 Open-Vocabulary Object Detection Using Captions(2021 CVPR)----论文解读
Open-Vocabulary Object Detection Using Captions[2021CVPR]----论文解读papercode1. AbstractOpen-Vocabulary Object Detection Using Captions2. Introduction设想与构思思路与做法OVD、ZSD、 WSD的区别?3. Related WorkZSDWSDObject detection using mixed supervisionVisual grounding of re
2022-01-05 15:50:21
4165
原创 IoU-aware Single-stage Object Detector for Accurate Localization-----论文阅读笔记
IoU-aware Single-stage Object Detector for Accurate Localization-----论文阅读笔记原文和代码:Abstract存在的问题?解决办法Introduction总结:问题:作者解决方案:2. Related Work3. Method3.1. IoU-aware single-stage object detector3.2. Training3.3. Inference未写实验可以从参考原文原文和代码:原文代码Abstract存在的问
2021-09-27 14:24:23
631
原创 Variational Information Distillation----论文阅读笔记
Variational Information Distillation主要贡献:VIDAlgorithm formulation代码(重点在这,方便理解)提出了一个最大化师生网络互信息作为知识转移的信息论框架。主要贡献:我们提出了变分信息提取,这是一种基于变分信息最大化技术,通过最大化两个网络之间的互信息实现的原则性知识转移框架。我们证明了VID概括了几种现有的知识转移方法。此外,在各种知识转移实验中,我们的框架实现在经验上优于最先进的知识转移方法,包括相同数据集或不同数据集上(异构)DNN之间
2021-09-15 16:29:11
817
原创 Similarity-Preserving Knowledge Distillation(2019ICCV)----论文阅读笔记
Similarity-Preserving Knowledge DistillationAbstract1. IntroductionAbstract在训练网络的过程中,语义相似的输入倾向于在引发相似的激活模式。保持相似性的知识提取指导学生网络的训练,使在教师网络中产生相似(不同)激活的输入指导学生网络中产生相似(不同)激活。与以前的提取方法不同,学生不需要模仿教师的表示空间,而是要在自己的表示空间中保留成对的相似性。1. Introduction...
2021-09-15 11:19:04
1910
原创 Probabilistic Knowledge Transfer for Deep Representation Learning(2018)----论文笔记
Probabilistic Knowledge Transfer for Deep Representation LearningAbstract1. Introduction后续存在问题:本文提出的方法:优点:贡献2 Related Work3 Probabilistic Knowledge Transfer4 Experimental EvaluationAbstract1.蒸馏的知识:学习表示和label的互信息量 (mutual information between learned repre
2021-09-13 15:43:18
1509
原创 Self-supervised Knowledge Distillation using Singular Value Decomposition(2018ECCV)----阅读笔记
Self-supervised Knowledge Distillation using Singular Value Decomposition----阅读笔记AbstractIntroduction2 Related Works2.1 Knowledge Distillation2.2 SVD and RBF2.3 Training Mechanism3 Method3.1 Proposed Distillation ModuleTruncated SVDAbstract提出了一种新的
2021-09-11 21:32:33
1001
3
原创 Like What Y ou Like: Knowledge Distill via Neuron Selectivity Transfer(2017)------论文阅读笔记
Like What Y ou Like: Knowledge Distill via Neuron Selectivity Transfer------论文阅读笔记写在前面Abstract1. Introduction2. Related Works3. Background3.1. Notations3.2. Maximum Mean Discrepancy (最大平均偏差MMD)可视化结果4. Neuron Selectivity Transfer4.1. MotivationWhat is wrong
2021-09-10 20:10:17
782
原创 A Gift from Knowledge Distillation(2017 CVPR)----论文笔记
A Gift from Knowledge Distillation:Fast Optimization, Network Minimization and Transfer Learning(2017 CVPR)Abstract1. Introduction贡献2. Related Work3. Method3.1. Proposed Distilled Knowledge3.2. Mathematical Expression of the Distilled Knowledge3.3. Loss f
2021-09-08 17:08:44
762
原创 Correlation Congruence for Knowledge Distillation (2019 ICCV)----阅读笔记
Correlation Congruence for Knowledge DistillationAbstractIntrodution2.Related Work3.CCKD3.1 3.1. Background and Notations3.2. Knowledge Distillation3.3. Correlation Congruence3.4. Generalized kernel-based correlation3.5. Strategy for Mini-batch Sampler具体采样
2021-09-08 10:56:24
1058
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅