机器学习中一些常用方法的说明

最新推荐文章于 2022-09-03 14:50:54 发布

谁能告诉我怎么取网名

最新推荐文章于 2022-09-03 14:50:54 发布

阅读量283

点赞数

分类专栏：深度学习大数据算法文章标签：算法

本文链接：https://blog.csdn.net/qq_20073741/article/details/102758711

版权

深度学习同时被 3 个专栏收录

12 篇文章 0 订阅

订阅专栏

大数据

10 篇文章 0 订阅

订阅专栏

算法

8 篇文章 0 订阅

订阅专栏

持续更新。。。欢迎批评

很多方法讲的都是原理，虽然讲的很对，但是看不懂，也不说这个东西是干嘛用的，就知道使用而使用，知道是用来干嘛的，才想去看原理

1.归一化、正则化、标准化

归一化：防止数据倾斜，导致所占比重过大。将原始数据线性化的方法转换到[0 1]的范围，该方法实现对原始数据的等比例缩放。通过利用变量取值的最大值和最小值（或者最大值）将原始数据转换为界于某一特定范围的数据，从而消除量纲和数量级影响。

正则化：是一种为了减小测试误差的行为(有时候会增加训练误差)，

我们在构造机器学习模型时，最终目的是让模型在面对新数据的时候，可以有很好的表现。当你用比较复杂的模型比如神经网络，去拟合数据时，很容易出现过拟合现象(训练集表现很好，测试集表现较差)，这会导致模型的泛化能力下降，这时候，我们就需要使用正则化，降低模型的复杂度。

标准化：数据的标准化是将数据按比例缩放，使之落入一个小的特定区间。在现实生活中，一个目标变量（y）可以认为是由多个特征变量（x）影响和控制的，那么这些特征变量的量纲和数值的量级就会不一样，比如x1 = 10000，x2 = 1，x3 = 0.5 可以很明显的看出特征x1和x2、x3存在量纲的差距；x1对目标变量的影响程度将会比x2、x3对目标变量的影响程度要大（可以这样认为目标变量由x1掌控，x2，x3影响较小，一旦x1的值出现问题，将直接的影响到目标变量的预测，把目标变量的预测值由x1独揽大权，会存在高风险的预测）而通过标准化处理，可以使得不同的特征变量具有相同的尺度（也就是说将特征的值控制在某个范围内），这样目标变量就可以由多个相同尺寸的特征变量进行控制，这样，在使用梯度下降法学习参数的时候，不同特征对参数的影响程度就一样了。比如在训练神经网络的过程中，通过将数据标准化，能够加速权重参数的收敛。
简而言之：对数据标准化的目的是消除特征之间的差异性，便于特征一心一意学习权重。

总的来说，归一化是为了消除不同数据之间的量纲，方便数据比较和共同处理，比如在神经网络中，归一化可以加快训练网络的收敛性；标准化是为了方便数据的下一步处理，而进行的数据缩放等变换，并不是为了方便与其他数据一同处理或比较，比如数据经过零-均值标准化后，更利于使用标准正态分布的性质，进行处理；正则化而是利用先验知识，在处理过程中引入正则化因子(regulator)，增加引导约束的作用，比如在逻辑回归中使用正则化，可有效降低过拟合的现象。

2. one-hot编码

增强模型的非线性能力

3.SVM中惩罚参数C

C值越大对于训练集的表现越好，但是间隔减小也就是对于噪声等干扰的容忍度减小，可能引发过度拟合（overfitting），这时说明对于噪声的惩罚力度太大。

谁能告诉我怎么取网名

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
机器学习中一些常用方法的说明

持续更新。。。欢迎批评很多方法讲的都是原理，虽然讲的很对，但是看不懂，也不说这个东西是干嘛用的，就知道使用而使用，知道是用来干嘛的，才想去看原理1.归一化、正则化、标准化归一化：防止数据倾斜，导致所占比重过大。将原始数据线性化的方法转换到[0 1]的范围，该方法实现对原始数据的等比例缩放。通过利用变量取值的最大值和最小值（或者最大值）将原始数据转换为界于某一特定范围的数据，从而...
复制链接

扫一扫