深度学习优化函数详解（6）-- adagrad

最新推荐文章于 2022-10-14 14:45:02 发布

ChasingdreamLY

最新推荐文章于 2022-10-14 14:45:02 发布

阅读量1k

点赞数 1

分类专栏：深度学习文章标签：深度学习函数优化

深度学习专栏收录该内容

37 篇文章 15 订阅

订阅专栏

本文介绍了Adagrad这一自适应学习率优化算法，该算法能够针对不同参数动态调整学习率，加速深度学习模型训练过程中的收敛速度。通过公式推导及实验结果展示了Adagrad的工作原理及其在实际应用中的表现。

摘要由CSDN通过智能技术生成

深度学习优化函数详解系列目录
深度学习优化函数详解（0）– 线性回归问题
深度学习优化函数详解（1）– Gradient Descent 梯度下降法
深度学习优化函数详解（2）– SGD 随机梯度下降
深度学习优化函数详解（3）– mini-batch SGD 小批量随机梯度下降
深度学习优化函数详解（4）– momentum 动量法
深度学习优化函数详解（5）– Nesterov accelerated gradient (NAG)
深度学习优化函数详解（6）– adagrad

前面的一系列文章的优化算法有一个共同的特点，就是对于每一个参数都用相同的学习率进行更新。但是在实际应用中各个参数的重要性肯定是不一样的，所以我们对于不同的参数要动态的采取不同的学习率，让目标函数更快的收敛。
adagrad方法是将每一个参数的每一次迭代的梯度取平方累加再开方，用基础学习率除以这个数，来做学习率的动态更新。这个比较简单，直接上公式。

公式推导