pyTorch--梯度下降

梯度下降算法

由于穷举法时间复杂度高,如果未知权重多,其得到结果时间十分可观,这里利用随机梯度下降算法

算法公式

利用偏导数得到曲线斜率,根据斜率的正负,沿斜率为正下降(梯度下降)直到驻点结束。
其中图中圈红的是学习率,从数学角度分析也即每次要移动距离(其实就是个系数),这个不能取太大,应该微调要不然难以收敛
在这里插入图片描述
在这里插入图片描述

缺陷

这样的方法只能得到局部最优
但是损失函数曲线不一定是一个二次抛物线,可能有鞍点,这个是要求得最佳权重的难点

在这里插入图片描述

随机梯度下降与普通梯度下降

随机梯度下降更新参数公式:在这里插入图片描述

普通梯度下降更新参数公式:在这里插入图片描述
很明显可以看到,随机梯度下降用的是部分且随机样本,得到局部的最优,而普通梯度下降是用的全部数据,理论上没有驻点可以得到全局最优解,但是驻点经常会有,即使这样求局部最优不一定能得到全局最优,但是这样处理已经比普通梯度下降好的多。对于不能得到全局最优,实际上可以改变学习率尽量接近全局最优。
随机梯度下降优点:有效避免驻点;缺点:不一定是全局最优
普通梯度下降优点:可以很好运用计算机并行运算的机制提高运算效率;缺点:无法排除驻点

对线性方程用梯度下降求损失函数

把线性方程带入求偏导数:
在这里插入图片描述
代码实现:


import matplotlib.pyplot as plt
 
x_data = [1.0, 2.0, 3.0]
y_data = [2.0, 4.0, 6.0]
 
w = 1.0
 
def forward(x):
    return x*w
 
# calculate loss function
def loss(x, y):
    y_pred = forward(x)
    return (y_pred - y)**2
 
# define the gradient function  sgd
def gradient(x, y):
    return 2*x*(x*w - y)
 
epoch_list = []
loss_list = []
print('predict (before training)', 4, forward(4))
for epoch in range(100):
    for x,y in zip(x_data, y_data):
        grad = gradient(x,y)
        w = w - 0.01*grad    # update weight by every grad of sample of training set
        print("\tgrad:", x, y,grad)
        l = loss(x,y)
    print("progress:",epoch,"w=",w,"loss=",l)
    epoch_list.append(epoch)
    loss_list.append(l)
 
print('predict (after training)', 4, forward(4))
plt.plot(epoch_list,loss_list)
plt.ylabel('loss')
plt.xlabel('epoch')
plt.show()
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值