《昇思25天学习打卡营第6天|函数式自动微分》

源远流长冬夏青青

于 2024-06-29 11:33:48 发布

阅读量531

点赞数 29

文章标签：学习

本文链接：https://blog.csdn.net/QAQ23333333333/article/details/140059165

版权

文章目录

一、函数式自动微分是什么？
二、计算图是什么？
三、计算损失
四、微分函数与梯度计算
五、神经网络梯度计算
总结
个人打卡

一、函数式自动微分是什么？

神经网络的训练主要使用反向传播算法，模型预测值（logits）与正确标签（label）送入损失函数（loss function）获得loss，然后进行反向传播计算，求得梯度（gradients），最终更新至模型参数（parameters）。自动微分能够计算可导函数在某点处的导数值，是反向传播算法的一般化。自动微分主要解决的问题是将一个复杂的数学运算分解为一系列简单的基本运算，该功能对用户屏蔽了大量的求导细节和过程，大大降低了框架的使用门槛。

二、计算图是什么？

计算图是用图论语言表示数学函数的一种方式，也是深度学习框架表达神经网络模型的统一方法。我们将根据下面的计算图构造计算函数和神经网络。

compute-graph

三、计算损失

观察以上计算图，在这个模型中， $x$ 为输入， $y$ 为正确值， $w$ 和 $b$ 是我们需要优化的参数（优化参数得到更好的网络模型）， $z$ 相当于输入 $x$ 经过网络模型计算得出的结果。
在这里插入图片描述

我们根据计算图描述的计算过程，构造计算函数。
其中，binary_cross_entropy_with_logits 是一个损失函数，计算预测值和目标值之间的二值交叉熵损失。

执行计算函数，可以获得计算的loss值并打印。

四、微分函数与梯度计算

为了优化模型参数，需要求参数对loss的导数： $\frac{\partial \operatorname{loss}}{\partial w}$ 和 $\frac{\partial \operatorname{loss}}{\partial b}$ ，此时我们调用mindspore.grad函数，来获得function的微分函数。

这里使用了grad函数的两个入参，分别为：

fn：待求导的函数。
grad_position：指定求导输入位置的索引。

由于我们对 $w$ 和 $b$ 求导，因此配置其在function入参对应的位置(2, 3)。

使用grad获得微分函数是一种函数变换，即输入为函数，输出也为函数。

在这里插入图片描述
可以看到，求得 $w$ 、 $b$ 对应的梯度值发生了变化。

五、神经网络梯度计算

前述章节主要根据计算图对应的函数介绍了MindSpore的函数式自动微分，但我们的神经网络构造是继承自面向对象编程范式的nn.Cell。接下来我们通过Cell构造同样的神经网络，利用函数式自动微分来实现反向传播。

首先我们继承nn.Cell构造单层线性变换神经网络。这里我们直接使用前文的 $w$ 、 $b$ 作为模型参数，使用mindspore.Parameter进行包装后，作为内部属性，并在construct内实现相同的Tensor操作。

在这里插入图片描述
接下来我们实例化模型和损失函数。

完成后，由于需要使用函数式自动微分，需要将神经网络和损失函数的调用封装为一个前向计算函数。

完成后，我们使用value_and_grad接口获得微分函数，用于计算梯度。

由于使用Cell封装神经网络模型，模型参数为Cell的内部属性，此时我们不需要使用grad_position指定对函数输入求导，因此将其配置为None。对模型参数求导时，我们使用weights参数，使用model.trainable_params()方法从Cell中取出可以求导的参数。

在这里插入图片描述
执行微分函数，可以看到梯度值和前文function求得的梯度值一致。