机器学习: 最小二乘与贝叶斯估计

在线性回归中,我们最常用到的是最小二乘法,给定一组样本 S={xi},i=1,2,...N 和目标值 t={t1,t2,...tN} ,
我们希望找到一种映射关系 y(x,w)=wTx , 最小二乘法就是通过求解如下的目标函数来求 w :

E=12i=1N(tiy(xi,w))2

接下来我们从贝叶斯估计出发,探讨最小二乘与贝叶斯估计中最大似然估计和最大后验概率估计的关系。因为 y(x,w) 只是目标值 t 的近似估计,所以两者满足如下的关系:

t=y(x,w)+ϵ

如果我们假设 ϵ 是满足均值为 0 , precision (精确度)为 β的高斯分布,这里 β 即为方差的倒数。那么我们有:

p(t|x,w,β)=N(t|y(x,w),β1)

进一步假设样本分布满足 i.i.d 即独立同分布,那么这组样本的联合概率满足:

p(t|S,w,β)=i=1NN(ti|wTxi,β1)

利用最大似然估计,可以得到:

lnp(t|S,w,β)=i=1Nln(N(ti|wTxi,β1))

=N2lnβN2ln(2π)βED(w)

ED(w) 就是:

ED(w)=12i=1N(tiwTxi)2

可以看到,高斯分布下的最大似然估计就是最小二乘。我们可以求出最优的 w , 假设对应最大似然估计下的最优解为 wML , 可以进一步求出最大似然估计下的精确度 β 为:

1βML=1Ni=1N(tiwTMLxi)2

那么给定一个新的 x , 其对应的预测值 t 满足如下的高斯分布,

p(t|x,wML,βML)=N(t|y(x,wML),β1ML)

显然,当 t=y(x,wML) 的时候,所对应的概率是最大的。从最大似然估计出发,我们可以得到最小二乘。

接下来,考虑最大后验概率估计,给 w 一个先验分布,假设 w 的分布也是满足高斯形式:

p(w|α)=N(w|0,α1I)=(α2π)(M+1)/2exp(α2wTw)

根据贝叶斯定理,我们知道后验概率与先验概率和似然函数之积是成一定比例的:

p(w|t,S,α,β) p(t|w,S,β)p(w|α)

利用最大似然估计,对 p(t|w,S,β)p(w|α) 取对数,去掉无关项,我们可以得到如下的表达式:

E(w)= β2i=1N(tiwTxi)2+α2wTw

λ=αβ , 那么上式可以写成:

E(w)= 12i=1N(tiwTxi)2+λ2wTw

这个就是带正则项的最小二乘,这个可以减轻over fitting的问题。所以最大后验概率估计对应的就是带正则项的最小二乘。

所以,通过高斯分布,可以将贝叶斯估计与最小二乘联系起来。

>
C.M.Bishop, “Pattern Recognition and Machine Learning”.

  • 3
    点赞
  • 19
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值