【深度学习基础知识 - 23】深度学习中常用的优化器

最新推荐文章于 2024-08-02 21:04:01 发布

雁宇up

最新推荐文章于 2024-08-02 21:04:01 发布

阅读量1.8k

点赞数 4

分类专栏：深度学习文章标签：算法深度学习人工智能

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/yanyuxiangtoday/article/details/119848374

版权

深度学习专栏收录该内容

52 篇文章 59 订阅

订阅专栏

深度学习任务中一般都采用优化器来决定模型的梯度更新算法，本文简单对常用的优化器做个简单介绍。

SGD

SGD（stochastic gradient descent）随机梯度下降：单条数据就可以对参数进行一次更新。优点是参数更新快，缺点是每次更新采用的数据量小，容易震荡。

BGD

BGD（batch gradient descent）批量梯度下降：所有数据都参与参数的每一次更新。优点是梯度更新平滑，缺点是参数更新较慢。

MBGD

MBGD（min-batch gradient descent）小批量梯度下降：每次更新都只取数据中的一部分参与运算，是目前最常见的梯度更新策略。有点事相随与随机梯度下降，梯度更新更加平滑，且不会像BGD一样参数更新缓慢。但是需要制定每个batch中的数据均衡策略保证训练不会出现震荡。

momentum

主要解决随机梯度下降时的震荡问题，通过加入一个momentum参数，以本次计算得到的梯度和上次梯度更新的加权和作为本次要更新的梯度，加速网络收敛，同时抑制震荡，但是有可能难以找到最优点，因此在模型训练的后期通常会将其关闭。

Adagrad

Adagrad（adaptive gradient algorithm），实际上是在梯度更新时依据每个参数的重要程度对其进行自适应加权，具体做法是将低频的参数和高频的参数分开处理，对低频参数做较大的更新，高频参数进行较小的更新。可以不用手动调节学习率，但是最红学习率会变得非常小。

RMSprop

主要解决Adagrad学习率会急剧下降的问题。

Adam

Adam（adaptive moment estimation）是目前最常被采用的优化器，是每个参数自适应学习率的方法。相当于RMSprop和momentum的结合。

博主会持续更新一些深度学习相关的基础知识以及工作中遇到的问题和感悟，喜欢请关注、点赞、收藏，感谢大家。

关注

4
点赞
踩
6

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

雁宇up 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。