【动手学深度学习】前向传播、反向传播和计算图

最新推荐文章于 2024-01-18 02:08:26 发布

xyy ss

最新推荐文章于 2024-01-18 02:08:26 发布

阅读量730

点赞数

分类专栏：动手学深度学习文章标签：深度学习机器学习人工智能

本文链接：https://blog.csdn.net/weixin_45057858/article/details/126370332

版权

动手学深度学习专栏收录该内容

11 篇文章 0 订阅

订阅专栏

前向传播
前向传播(forward propagation或forward pass)指的是:按顺序(从输入层到输出层)计算和存储神经网络中每层的结果
在这里插入图片描述
前向传播的计算图
反向传播
反向传播(backward propagation或backpropagation)指的是计算神经网络参数梯度的方法。简言之，该方法根据微积分中的链式规则,按相反的顺序从输出层到输入层遍历网络。该算法存储了计算某些参数梯度时所需的任何中间变量(偏导数)。假设我们有函数Y=f(x)和z=g(y),其中输入和输出X,Y,Z是任意形状的张量。
训练神经网络
在训练神经网络时,前向传播和反向传播相互依赖。对于前向传播,我们沿着依赖的方向遍历计算图并计算其路径上所有的变量。然后将这些用于反向传播，其中计算顺序与计算图的相反。以上述简单网络为例:一方面,在前向传播期间计算正则项取决于模型参数W1和W2的当前值。它们是由优化算法根据最近迭代的反向传播给出的。另一方面，反向传播期间参数的梯度计算，取决于由前传播给出的隐藏变量h的当前值。
因此，在训练神经网络时,在初始化模型参数后,我们交替使用前向传播和反向传播,利用反向传播给出的梯度来更新模型参数。注意，反向传播重复利用前向传播中存储的中间值，以避免重复计算。带来的影响之一是我们需要保留中间值，直到反向传播完成。这也是训练比单纯的预测需要更多的内存(显存)的原因之一。此外，这些中间值的大小与网络层的数量和批量的大小大致成正比。因此，使用更大的批量来训练更深层次的网络更容易导致内存不足(out of memory)错误。
小结: