01 过拟合问题
正则化可以减少过度拟合问题
1.1 线性回归过拟合问题
- 欠拟合 | 刚好合适 | 过拟合
- 过度拟合问题将会在变量过多的时候出现,这时训练出的假设能够很好的拟合训练集(所以代价函数实际上可能非常接近于0。或者恰好等于0),但是可能会得到图三这样的曲线,去拟合训练集,以至于它无法泛化到新的样本中。
- 泛化是指一个假设模型应用到新样本的能力
1.2 逻辑回归过拟合问题
- 欠拟合 | 刚好合适 | 过拟合
- 如果我们有过多的特征变量而只有少量的训练集就会出现过拟合问题。
- 有两种方法解决过拟合问题:
- 尽量减少特征变量的数量(模型选择算法会自动选择哪些变量保留,哪些舍弃)
- 正则化:减少量级或者参数的大小
02 代价函数
- 正则化将多阶函数变成二阶函数(将参数尽可能减小),这些参数越小,我们得到的图像也就越圆滑越简单。
- 一般来说我们只对参数1以及1之后的进行正则化
- 在对代价函数进行修改,添加正则化项的目的是为了缩小参数的值。
- 正则化参数是为了控制两个不同目标之间的取舍
- 正则化参数如果过大,那么参数都会接近于0,这样就相当于把假设函数的全部项都忽略了,最终变成了欠拟合。
03 线性回归的正则化
- 线性回归正则化的梯度下降法
- 线性回归正则化的正规方程法
- m<=n,说明矩阵是不可逆的,但是当正则参数>0,算出来的矩阵一定是可逆的。
04 Logistic 回归的正则化
- Logistic 回归添加正则化项
- Logistic 回归的正则化的梯度下降法
- 如何在更高级的算法中使用正则化:定义一个costFunction函数,以theta作为输入。在fminunc函数中括号里写上@cosFunction。
- fminunc的意思是函数在无约束条件下的最小值,fminunc函数会将costFunction函数最小化,