多层感知机

最新推荐文章于 2024-07-02 16:18:39 发布

头号大眼睛

最新推荐文章于 2024-07-02 16:18:39 发布

阅读量509

点赞数

分类专栏：机器学习文章标签：多层感知机概念前向求导backgrad注意事项

本文链接：https://blog.csdn.net/ZzH7HN/article/details/104269978

版权

机器学习专栏收录该内容

11 篇文章 0 订阅

订阅专栏

多层感知机的基本知识

深度学习主要关注多层模型。在这里，我们将以多层感知机（multilayer perceptron，MLP）为例，介绍多层神经网络的概念。

隐藏层

下图展示了一个多层感知机的神经网络图，它含有一个隐藏层，该层中有5个隐藏单元。

Image Name

表达公式

具体来说，给定一个小批量样本X∈ $R^{n\times d}$ ，其批量大小为n，输入个数为d。假设多层感知机只有一个隐藏层，其中隐藏单元个数为h。记隐藏层的输出（也称为隐藏层变量或隐藏变量）为H，有H∈ $R^{n\times h}$ 。因为隐藏层和输出层均是全连接层，可以设隐藏层的权重参数和偏差参数分别为Wh∈ $R^{d\times h}$ 和 bh∈ $R^{1\times h}$ ，输出层的权重和偏差参数分别为Wo∈ $R^{h\times d}$ 和bo∈ $R^{1\times q}$

我们先来看一种含单隐藏层的多层感知机的设计。其输出O∈ $R^{n\times q}$ 的计算为

$\begin{aligned} \boldsymbol{H} &= \boldsymbol{X} \boldsymbol{W}_h + \boldsymbol{b}_h,\\ \boldsymbol{O} &= \boldsymbol{H} \boldsymbol{W}_o + \boldsymbol{b}_o, \end{aligned}$

也就是将隐藏层的输出直接作为输出层的输入。如果将以上两个式子联立起来，可以得到

$\boldsymbol{O} = (\boldsymbol{X} \boldsymbol{W}_h + \boldsymbol{b}_h)\boldsymbol{W}_o + \boldsymbol{b}_o = \boldsymbol{X} \boldsymbol{W}_h\boldsymbol{W}_o + \boldsymbol{b}_h \boldsymbol{W}_o + \boldsymbol{b}_o.$

从联立后的式子可以看出，虽然神经网络引入了隐藏层，却依然等价于一个单层神经网络：其中输出层权重参数为 $\boldsymbol{W}_h\boldsymbol{W}_o$ ，偏差参数为 $\boldsymbol{b}_h \boldsymbol{W}_o + \boldsymbol{b}_o$ 。不难发现，即便再添加更多的隐藏层，以上设计依然只能与仅含输出层的单层神经网络等价。