自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(85)
  • 资源 (1)
  • 收藏
  • 关注

原创 一篇文章讲清楚:XGBoost(极限梯度提升树)

pd.concat([x_train, y_train], axis=1).to_csv('./data/红酒品质分类_train.csv', index = False) # 忽略索引。pd.concat([x_test, y_test], axis=1).to_csv('./data/红酒品质分类_test.csv', index=False)# print(pd.concat([x_train, y_train], axis = 1)) # 拼接特征数据,axis = 1 表示横向拼接。

2026-09-04 19:35:04 10

原创 一篇文章讲清楚:Adaboost算法与GBDT

print(df_wine['Class label'].unique()) # [1 2 3] 葡萄酒类别,但是决策树只能识别 二叉树。print(f'AdaBoost集成学习预测正确率:{accuracy_score(y_test, y_pred2)}')s。print(f'单一决策树模型的准确率为:{accuracy_score(y_test, y_pred1)}')# 参1:弱分类器(决策树对象),参2:弱分类器个数,参3:学习率。

2026-09-03 18:39:51 140

原创 一篇文章讲清楚:随机森林

了解集成学习的分类,理解Bagging集成学习的思想,理解Boosting集成学习的思想。然后是关于随机森林的知识,理解随机森林的构建方法,知道随机森林的API,能够使用随机森林完成分类任务。,这样每棵树都是“有偏的”,也就是说每棵树训练出来都是有很大的差异的;集成学习是机器学习中的一种思想,它通过多个模型的组合形成一个精度更高的模型,参与组合的模型成为弱学习器。训练时,使用训练集依次训练出这些弱学习器,对未知的样本进行预测时,使用这些弱学习器联合进行预测。产生不同的训练集,从而训练不同的学习器。

2026-09-03 09:12:20 198

原创 一篇文章讲清楚:C4.5决策树和CART决策树

ID3 基于信息增益,当某个特征取值种类很多时,分裂后会产生大量小的子集,子集容易达到高纯度,条件熵大幅下降,信息增益偏大;算法会优先挑选这类特征,造成偏向取值多的特征。C4.5 使用信息增益比,引入特征自身熵做分母,对高基数特征进行惩罚,缓解该问题。信息增益越大,代表这个特征分裂之后,整体数据变得越 “干净”。可以进行分类和回归,可处理离散属性,也可以处理连续属性。做特征选择:选择信息增益最大的特征做分裂。理解基尼指数的作用,b的信息增益率,根据信息增益率,应该选择。特征的信息增益 ➗ 特征的内在信息。

2026-09-02 09:30:16 198

原创 一篇文章讲清楚:ID3决策树

树中每个内部节点表示一个特征上的判断,每个分支代表一个判断结果的输出,每个叶子节点代表一种分类结果。理解决策树算法的基本思想,知道构建决策树的步骤,理解信息熵的意义,理解信息增益的作用,使用该特征(信息增益最大的特征)作为决策树的一个节点。熵越大,数据的不确定性度越高,信息就越多。决策树生成:根据选择的特征生成决策树。特征选择:选取有较强分类能力的特征。信息论中代表随机变量不确定度的度量。使用信息增益最大的特征将数据集。熵越小,数据的不确定性越低。决策树也易过拟合,采用。计算每个特征的信息增益。

2026-09-01 16:18:11 215

原创 一篇文章讲清楚:分类问题的评估方法

y_pred_A = ['恶性', '恶性', '恶性', '良性', '良性', '良性', '良性', '良性', '良性', '良性']y_pred_B = ['恶性', '恶性', '恶性', '恶性', '恶性', '恶性', '良性', '恶性', '恶性', '恶性']y_train = ['恶性', '恶性', '恶性', '恶性', '恶性', '恶性', '良性', '良性', '良性', '良性']:所有的负样本都预测错误,表示所有的正样本都预测正确。

2026-08-31 16:43:28 256

原创 一篇文章讲清楚:逻辑回归

已知掷出来的数一定是{1,2,3},现在看其中是偶数的只有 2。逻辑回归的应用场景,复习逻辑回归应用到的数学知识,理解逻辑回归算法的原理,含义:已经知道掷出的点数≤3,在这个条件下,它是偶数的概率为1/3。2. 条件概率 P(A|B):已知 B 发生,求 A 发生。1. 联合概率 P(A,B):A 并且 B 同时发生。,出现正面的概率和反面的概率是不同的。模型,把线性回归的输出,作为逻辑回归的输入。例子:掷一枚骰子(点数 1‑6,等概率)事件 B:掷出≤3 的数 {1,2,3}

2026-08-30 19:40:47 230

原创 一篇文章讲清楚:欠拟合和过拟合

X3 = np.hstack([X, X ** 2, X ** 3, X ** 4, X ** 5, X ** 6, X ** 7, X ** 8, X ** 9, X ** 10]) # 该函数作用:横向拼接,即:拼接2个数组,拼接后数组的列数等于拼接数组的列数之和。# 即:把数据从[[1],[2],[3],[4],[5]] => [[1,1**2,1**3,1**4,1**5,……], [2,2**2,2**3,2**4,……], [2,2**2,2**3,2**4,……

2026-08-30 11:33:34 152

原创 一篇文章讲清楚:回归评估方法

RMSE放大大误差的数据点对指标的影响, 但是对异常数据比较敏感。1.举个栗子:我们绘制了一条直线 y = 2x +5。RMSE会放大预测误差较大的样本的影响。,因此大的误差将被平方,因此会增加。,因为它对预测误差较大的点比较敏感。都能反映出预测值和真实值之间的误差。非常接近,都表明模型的误差很低。对比第一张图,所有指标都变大了,指标来优化模型,让模型的误差。说明模型对异常点(对噪声)所以评价指标要综合的看。不能体现出误差大的数据点,掌握常用的回归评估方法,了解不同评估方法的特点。RMSE的计算公式中。

2026-08-29 15:37:49 221

原创 一篇文章讲清楚:梯度下降法 –案例银行信贷

只考虑每月薪资(元)、存款余额(元)、房产面积(平方米)目标:计算数据样本产生的梯度,求解线性回归模型。一、案例:梯度下降法计算每个样本产生的梯度。梯度下降法与正规方程对比。梯度下降公式更新权重。

2026-08-29 12:06:41 154

原创 一篇文章讲清楚:梯度下降算法

步长决定了在梯度下降迭代的过程中,每一步沿梯度负方向前进的长度。小结:经过四次的运算,即走了四步,基本抵达了函数的最低点。掌握梯度下降算法的思想;知道梯度下降算法的分类。五、梯度下降公式中,为什么梯度要乘以一个负号。、产生下降过程中的震荡、甚至梯度爆炸。知道正规方程和梯度下降算法的特点。我们开始进行梯度下降的迭代计算过程。循环迭代求当前点的梯度,更新。梯度是上升最快的方向,我们需要是下降最快的方向。函数在此点上升最快的方向。单变量函数中,梯度就是。多变量函数中,梯度就是。有方向:偏导数分量的。

2026-08-29 10:13:13 203

原创 一篇文章讲清楚:线性回归问题的求解——正规方程法

的差异,为优化参数指明了方向。通过这篇文章我们需要。

2026-08-29 09:29:41 167

原创 一篇文章讲清楚:机器学习所用的数学知识

常数、指数函数、幂指数、正弦余弦都有自己的导函数,会查表应用。机器学习中常见的数据表述;比如张三的数理化成绩信息:70,80,90。是数学中的一种基本概念,具有长度的。矩阵是数学中的一种基本概念,表达。:先对外函数求导,在对内函数求导。各个分量上求偏导,会形成一个向量。,张量是基于向量和矩阵的推广。先对外函数求导,再对内函数求导。1.标量、向量、矩阵、张量概念。单位阵:一种特殊的方阵 符号。知道向量和矩阵的简单运算。向量指一列顺序排列的元素。对称方阵:一种特殊的方阵,机器学习中常见的数据表述。

2026-08-28 21:13:54 240

原创 一篇文章讲清楚:线性回归

(3)特征工程(特征提取,特征预处理);知道一元线性回归和多元线性回归的区别,来拟合身高和体重之间的关系,再对新数据进行预测。效果的函数,也叫代价函数、成本函数、目标函数。因此,我们需要找到一个评价指标——损失函数。假若有了身高和体重数据,来了播仔的。的函数,也叫代价函数、目标函数。关系进行建模的一种分析方式。通过这篇文章,我们需要理解。知道线性回归的应用场景。三、线性回归问题的求解。首先需要了解误差的概念。损失函数:衡量每个样本。可快速的找到拟合结果。,那是怎么求解的呢?

2026-08-28 17:06:58 314

原创 一篇文章讲清楚:超参数的选择方法——交叉验证和网格搜索

print(f'最优的估计器对象:{estimator.best_estimator_}') # KNeighborsClassifier(n_neighbors=3)print(f'最优超参组合:{estimator.best_params_}') # {'n_neighbors': 3}# 参3:交叉验证的折数,这里的4折表示:每个超参组合,都会进行4次交叉验证,这里共计是 4*10=10。# 参1:数据集的特征数据, 参2:数据集的标签数据, 参3:测试集的比例,参4:随机种子。

2026-08-27 15:06:09 288

原创 案例实操:利用KNN算法对鸢尾花分类

print(f'特征对应的名称:{iris_data.feature_names}') # ['sepal length (cm)', 'sepal width (cm)', 'petal length (cm)', 'petal width (cm)']print(f'标签对应的名称:{iris_data.target_names}') # ['setosa' 'versicolor' 'virginica']该函数适用于:第一次进行标准化的时候使用,一般用于处理训练集。

2026-08-27 11:49:44 433

原创 一篇文章讲清楚:特征预处理(归一化和标准化)

通过这篇文章,我们需要知道知道为什么进行归一化、标准化;能应用归一化API处理数据;能应用标准化API处理数据;使用KNN算法进行鸢尾花分类。

2026-08-17 18:24:18 311

原创 一篇文章讲清楚:几种距离度量

通过这篇文章,我们需要掌握欧氏距离的计算方法;掌握曼哈顿距离的计算方法;了解切比雪夫距离的计算方法;了解闵可夫斯基距离的计算方法。一、欧氏距离欧氏距离 Euclidean Distance:直观的距离度量方法,两个点在空间中的距离一般都是指欧氏距离。一般直接指的是两者之间的直线距离。

2026-08-17 17:42:53 176

原创 一篇文章讲清楚:KNN算法

1.KNN概念一个样本最相似的k个样本中的大多数属于某一个类别,则该样本也属于这个类别。2.KNN分类流程1.计算未知样本到每一个训练样本的距离2.将训练样本根据距离大小升序排列3.取出距离最近的K个训练样本4.进行多数表决,统计K个样本中哪个类别的样本个数最多5.将未知的样本归属到出现次数最多的类别3.KNN回归流程1.计算未知样本到每一个训练样本的距离2.将训练样本根据距离大小升序排列3.取出距离最近的K个训练样本4.把这个K。

2026-08-16 11:07:46 334

原创 一篇文章搞清楚:模型拟合问题

这篇文章主要讲解模型拟合相关问题,这里我们需要知道拟合是什么?1.理解过拟合、欠拟合是什么?知道过拟合、欠拟合出现的原因?理解泛化是什么?

2026-08-15 17:11:50 176

原创 一篇文章搞清楚:机器学习建模流程与特征工程

机器学习的三要素是数据、算法和算力,算法由我们自身决定。这篇文章我们首先总体了解机器学习建模流程,再重点了解其中的特征工程。

2026-08-14 21:57:50 201

原创 一篇文章讲清楚:机器学习的相关概念

摘要:本文系统介绍了机器学习的基础概念与核心算法分类。首先,详细阐述了样本、特征、标签、数据集划分等关键术语。其次,深入讲解了有监督学习、无监督学习、半监督学习和强化学习等主要算法类型,并通过分类与回归、聚类等具体问题加以说明,帮助读者快速构建对机器学习领域的整体认知框架。

2026-08-14 20:56:45 360

原创 开发第一个基于PyQt5的桌面应用

python -m PyQt5.uic.pyuic + .ui(ui文件名) -o + .py(py文件名)必须使用两个类:QApplication和QWidget。都在PyQt5.QtWidgets。普通按钮、工具条按钮、单选按钮、多选按钮、连接命令按钮。布局——垂直布局、水平布局、栅格布局、表张布局。列表控件、树控件、表格控件、列控件、撤销控件。Qt-Designer的介绍。将.ui文件转换为.py文件。利用扩展文件PyUIC转换。创建设计了一个小窗口。

2023-07-10 16:41:04 582

原创 手写数字识别——算法

链码特征:字符图片的每一个像素,将依据其8-领域像素的分布情况,归入8种不同的方向编码;总体思想:用户在书写数字时,其笔划路径将按照先后顺序被等距采点,并存储成一个序列串,然后将该序列与预先设定好的模板进行匹配,找到距离最小的模板,从而实现分类识别。特征提取:用三次样条分别插值数字图片的左、右轮廓之后,即可利用三次样条二阶导数连续的性质,找出字符左、右轮廓的凹陷区。基本思想:人在识别一个数字字符时,只需要简单观察字符是否有环,有几个环,再观察字符整体的凹凸形状,借此就可以识别数字字符。

2022-09-28 17:23:03 2038

原创 图像处理的数学模型与高性能算法——介绍

图像去模糊(复原)在数学上是一个不适定反问题,难度在于模糊矩阵接近奇异,且观测信号被噪声污染。对复原的解x有先验(prior)的物理假设,光滑性,稀疏性等等。数值迭代方法在很多科学计算领域有着广泛的应用,如机器学习,深度学习,数值代数,最优化等等。其中模糊矩阵A和模糊图片b已知,噪声e未知,但噪声的值很小。任务:观测到的图像是模糊,带有噪声的,如何尽可能复原出清晰的图像?任务:观测到的图像是模糊,带有噪声的,如何尽可能复原出清晰的图像?矩阵A是模糊算子,x是未知清晰复原图像,b是观测到的模糊图像。

2022-09-27 09:54:35 2356 1

原创 数学建模——相关系数

在数理统计中,这里的原假设和备择假设中的𝑟应该改为𝜌, 其中𝜌为未知的总体相关系数,实际上我们关心的是总体的统计特征。(2)在不确定两个变量是什么关系的情况下,即使算出皮尔逊相关系数,发现很大,也不能说明那两个变量线性相关,甚至不能说他们相关,我们一定要画出散点图来看才行。这里,我们选择正态分布和要检验的随机变量,并对其做出QQ图,可想而知,如果要检验的随机变量是正态分布,那么QQ图就是一条直线。(1)如果两个变量本身就是线性的关系,那么皮尔逊相关系数绝对值大的就是相关性强,小的就是相关性弱;

2022-09-21 16:57:26 3528 3

原创 数学建模-插值算法、拟合算法

尽管我们可以选择分段的方法避免这种现象,但是更多时候我们更倾向于得到一个确定的曲线,尽管这条曲线不能经过每一个样本点,但只要保证误差足够小即可(最小损失函数),这就是拟合的思想。%产生一个a至b之间的随机矩阵,大小为1x5;%产生一个均值为0,标准差(方差开根号)为2的正态分布的随机矩阵,大小为3x4;%产生一个-5至5之间的随机整数矩阵,大小为1x10;%产生一个1至10之间的随机整数矩阵,大小为2x5;%产生一个0至1之间的随机矩阵,大小为1x5;% (3)normrnd:产生正态分布的随机数。

2022-09-20 15:04:16 489

原创 数学建模—模糊综合评价模型

秃子悖论:一个满头秀发的人,n为这个人掉头发的根数(1)当n=1时,这个人不是秃子;论域U={x1, x2, x3, ....., xn},模糊集合为A,隶属度为A(xi)= 1, 2, 3, ...., n。A:模糊集合,U(A)=[0, 1],注意与{0,1}的区别,{0,1}只有0和1两个元素,[0, 1]有无限种可能。模糊集合分类:(1)偏小型(年轻,小,冷);(2)中间型(中年,种,暖);(3)偏大型(年老,大,热);a. 集合:具有相同属性的物质的集合,例如:颜色,性别,手机品牌,自然数集。

2022-09-08 10:00:29 978

原创 数学建模—灰色关联分析

记两级最小差:a = min(min(xi(k)-x0(k))),记两极最大差:b=max(max(xi(k)-x0(k)));第六步:通过比较三个子序列和母序列的关联度可以得出:该地区在2000年-2005年间的国内生产总值受到第三产业的影响最大(因为其灰色关联度最大)。absx0_xi = abs(x - repmat(y,1,size(x,2))) % 计算|X0-Xi|矩阵(在这里我们把X0定义为了Y)(2)子序列(又称为比较序列,子指标):影响系统行为的因素组成的数据系列(类似于自变量X)。..

2022-09-01 14:45:46 2831

原创 数学建模-基于熵权法对Topsis模型的修正

topsis模型赋予权重有层次分析法,但层次分析法也有其弊端。层次分析法最大的缺点:判断矩阵的确定依赖于专家,如果专家的判断存在主观性的话,会对结果产生很大的影响。(主观性太强)针对层次分析法主观性太强的弊端,我们可以采用熵权法给topsis评价模型的各个指标赋权。...

2022-06-15 20:50:41 2679

原创 数学建模-TOPSIS法

TOPSIS法(Technique for Order Preference by Similarity to Ideal Solution)可翻译为逼近理想解排序法,国内常简称为优劣解距离法。TOPSIS 法是一种常用的综合评价方法,其能充分利用原始数据的信息,其结果能精确地反映各评价方案之间的差距。...

2022-06-10 17:25:58 12999 2

原创 数学建模-层次分析法

层次分析法:建模比赛中最基础的模型之一,其主要用于解决评价类问题(例如:选择哪种方案最好、哪位运动员或者员工表现的更优秀)。评价类问题可用打分来解决。解决评价类问题,首先要想到一下三个问题:① 我们评价的目标是什么?② 我们为了达到这个目标有哪几种可选的方案?③ 评价的准则或者说指标是什么?(我们根据什么东西来评价好坏)...

2022-06-07 11:16:51 744

原创 李沐动手学深度学习-过拟合和欠拟合

模型容量拟合各种函数的能力低容量的模型难以拟合训练数据高容量的模型可以记住所有的训练数据模型容量的影响估计模型容量难以在不同的种类算法之间比较: 例如树模型和神经网络给定一个模型的种类,将有两个主要因素:参数的个数,参数值的选择范围VC维统计学习理论的一个核心思想对于一个分类模型,VC等于一个最大的数据集的大小,不管如何给定标号,都存在一个模型来对它进行完美分类。VC维的用处:提供为什么一个模型好的理论依据,它可以衡量训练误差和泛化误差之间的间隔;但深度学习中很少使用,衡量不是很准确,计算深度学习模型的V

2022-06-06 20:52:26 495

原创 李沐-动手学深度学习-多层感知机的实现

简单介绍了多层感知机的原理,及各个层之间的对应关系,多层感知机的代码实现。

2022-06-06 09:25:31 803

原创 李沐-动手学深度学习-感知机及激活函数的介绍

线性模型的不足:任何特征的增大都会导致模型输出的增大(如果对应的权重为正), 或者导致模型输出的减小(如果对应的权重为负)。似然函数:似然函数是一种关于统计模型参数的函数。而p(x|θ)也是一个有着两个变量的函数。如果,你将θ设为常量,则你会得到一个概率函数(关于x的函数);如果,你将x设为常量你将得到似然函数(关于θ的函数)。下面举一个例子:有一个硬币,它有θ的概率会正面向上,有1-θ的概率反面向上。θ是存在的,但是你不知道它是多少。为了获得θ的值,你做了一个实验:将硬币抛10次,得到了一个正

2022-05-31 11:06:10 1454

转载 李沐-动手学深度学习-softmax回归的从零开始实现

就像我们从零开始实现线性回归一样,你应该知道实现softmax的细节。和之前线性回归的例子一样,这里的每个样本都将用固定长度的向量表示。将展平每个图像,将它们视为长度为784的向量。因为我们的数据集有10个类别,所以网络输出维度为10。在实现softmax回归模型之前,我们简要回顾一下sum运算符如何沿着张量中的特定维度工作。回想一下,实现softmax由三个步骤组成1. 对每个项求幂(使用exp);2. 对每一行求和(小批量中每个样本是一行),得到每个样本的规范化常数;

2022-05-28 21:51:08 1024

原创 李沐-动手学深度学习-图像分类数据集

MNIST数据集是图像中广泛使用的数据集之一,但作为基准数据集过于简单。我们将使用类似但更复杂的Fashion-MNIST数据集。通过框架中的内置函数将Fashion-MNIST数据集下载并读取到内存中。Fashion-MNIST由10个类别的图像组成, 每个类别由训练数据集(train dataset)中的6000张图像 和测试数据集(test dataset)中的1000张图像组成。 因此,训练集和测试集分别包含60000和10000张图像。 测试数据集不会用于训练,只用于评估模型性能。

2022-05-27 17:57:08 1121 1

原创 李沐-动手学深度学习-损失函数介绍

损失函数(Loss Function):损失函数(loss function)就是用来度量模型的预测值f(x)与真实值Y的差异程度的运算函数,它是一个非负实值函数,通常使用L(Y, f(x))来表示,损失函数越小,模型的鲁棒性就越好。损失函数的作用:损失函数使用主要是在模型的训练阶段,每个批次的训练数据送入模型后,通过前向传播输出预测值,然后损失函数会计算出预测值和真实值之间的差异值,也就是损失值。得到损失值之后,模型通过反向传播去更新各个参数,来降低真实值与预测值之间的损失,使得模型生成的预测值

2022-05-27 09:41:55 1737

原创 李沐-动手学深度学习-softmax介绍

回归估计一个连续值分类预测一个离散类别softmax函数的解释:Softmax从字面上来说,可以分成soft和max两个部分。max故名思议就是最大值的意思。Softmax的核心在于soft,而soft有软的含义,与之相对的是hard硬。很多场景中需要我们找出数组所有元素中值最大的元素,实质上都是求的hardmax。hardmax最大的特点就是只选出其中一个最大的值,即非黑即白。但是往往在实际中这种方式是不合情理的,比如对于文本分类来说,一篇文章或多或少包含着各种主题信息,我们更期望得到文章

2022-05-26 11:23:55 3216

原创 李沐-动手学深度学习-线性回归

回归(regression)是能为一个或多个自变量与因变量之间关系建模的一类方法。线性模型可以看做是单层神经网络。线性回归是对n维输入的加权,外加偏差。使用平方损失来衡量预测值和真实值的差异。线性回归具有显示解。基础优化算法:梯度下降步骤1:挑选一个初始值w0步骤2:重复迭代参数沿梯度方向将增加损失函数值学习率:步长的超参数学习率:不能太小:效率低;也不能太大:震荡没有下降;总结:梯度下降通过不断沿着反梯度方向更新参数求解小批量随机梯度下降是深度学习默认的

2022-05-24 21:55:10 1095

opencv基于c++个人笔记总结

opencv基于c++语言编程的入门教程,在visval studio 2017环境下,适合于小白入门,各种基础opencv的函数使用查询。

2022-04-10

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除