李宏毅机器学习——梯度下降Gradient Descent

最新推荐文章于 2023-03-04 17:33:17 发布

thisissally

最新推荐文章于 2023-03-04 17:33:17 发布

阅读量248

点赞数

分类专栏：机器学习文章标签：自适应学习率梯度下降 Adagrad 特征缩放局部极值

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_45366750/article/details/119833378

版权

机器学习专栏收录该内容

15 篇文章

订阅专栏

本文探讨了在机器学习中自适应学习率的重要性，对比了普通梯度下降与Adagrad算法的差异。Adagrad通过整合微分占比来动态调整学习率，适合单参数模型，但在多参数场景下计算复杂。为解决这个问题，提出了特征缩放的解决方案，以标准化输入特征，提升学习效率。然而，梯度下降方法仍面临陷入局部极值、卡在非极值零点及早停问题的挑战。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

一、自适应学习率

在梯度下降的过程中，一般情况下，希望开始开始的时候学习率（学习的速度）快一些，后面慢慢接近局部最低的时候，学习率逐渐减小，移动的幅度更小且精确。

（一）普通的梯度下降

学习率的调整受到t和g的影响（g是微分），步长受到初始学习率、当前微分、当前时刻点的影响
在这里插入图片描述

（二）Adagrad

学习率的调整受到微分占比的影响（相当于把t和g整合成了占比这一个统计量），步长受到初始学习率、当前微分占比的影响。
在这里插入图片描述

二、Adagrad的使用场景

适用于单参数模型，这是其最大的缺点。原因有二：

不同参数需要不同的w
多参场景下，步长同时受到一阶导和二阶导的影响，计算复杂

【解决措施】特征缩放，即标准化
x的量纲不同，w对y的影响不同，w对损失函数的影响也不同。所以应该对x进行标准化，从而更新参数更容易且有效率。

三、梯度下降的限制

容易陷入局部极值
还有可能卡在不是极值，但微分值是0的地方
还有可能实际中只是当微分值小于某一个数值就停下来了，但这里只是比较平缓，并不是极值点

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。