动手学深度学习TF2.0第六课: 多层感知机

最新推荐文章于 2023-03-30 15:59:47 发布

爱发呆de白菜头

最新推荐文章于 2023-03-30 15:59:47 发布

阅读量471

点赞数 1

分类专栏：机器学习文章标签：多层感知机

本文链接：https://blog.csdn.net/qq_29797957/article/details/104000974

版权

机器学习专栏收录该内容

19 篇文章 1 订阅

订阅专栏

前面介绍的线性回归和softmax回归都是单层神经网络. 然而在深度学习中, 大多数是多层模型. 以下以多层感知机为例, 介绍多层神经网络.

1. 隐藏层

多层感知机在单层神经网络的基础上引入了１～Ｎ个隐藏层(hidden layer)．隐藏层位于输入层和输出层之间．
在这里插入图片描述
上图中含有一个隐藏层，该层中有５个隐藏单元；

输入层不参与计算，所以上图中的多层感知机的层数为２；

上图中的多层感知机隐藏层和输出层都是全连接层；

多层感知模型化

设输入样本为Ｘ, 隐藏层输出为Ｈ,隐藏层的有权重Ｗ1和偏差b1, 输出层输出为Ｏ．输出层的权重和偏差参数为W2和偏差２．

	Ｈ = X*W1+b1
	O = H*W2+b2
	
	==> O = (X*W1+b1)*W2+b2 = XW1W2+ b1*W2 + b2;

从最后式子的整理可以看出，即使添加再多的隐藏层，以上设计依然只能与仅含输出层的单层神经网络等价(可将Ｗ1W2当做权重，偏差为b1W2 + b2)．

2. 激活函数

上述问题的根源在与只对数据做了放射变换，而多个仿射变换的叠加仍然是一个仿射变换．

于是，引入了非线性变换，例如对隐藏变量使用按照元素运算的非线性函数变换，然后再作为下一个全连接层的输入．这个非线性函数被称为激活函数.

激活函数一: ReLU函数

ReLU函数就是只保留正数元素的同一个非线性变换, 该函数定义为:

在这里插入图片描述

## 定义一个绘图函数xyplot
%matplotlib inline
import tensorflow as tf
from matplotlib import pyplot as plt
import numpy as np
import random

def use_svg_display():
    # 用矢量图显示
    %config InlineBackend.figure_format = 'svg'

def set_figsize(figsize=(3.5, 2.5)):
    use_svg_display()
    # 设置图的尺寸
    plt.rcParams['figure.figsize'] = figsize

def xyplot(x_vals, y_vals, name):
    set_figsize(figsize=(5, 2.5))
    plt.plot(x_vals.numpy(), y_vals.numpy())
    plt.xlabel('x')
    plt.ylabel(name + '(x)')

 // tf.nn 提供relu函数
  x = tf.Variable(tf.range(-8,8,0.1), dtype=tf.float32)
  y = tf.nn.relu(x)
  xyplot(x, y, 'relu')
  
// ReLU导数
with tf.GradientTape() as t:
    t.watch(x)
    y=y = tf.nn.relu(x)
dy_dx = t.gradient(y, x)
xyplot(x, dy_dx, 'grad of relu')

激活函数二: sigmoid函数

sigmoid函数可以将元素的值变换到0-1之间:
在这里插入图片描述

## tf.nn 提供sigmoid函数
y = tf.nn.sigmoid(x)
xyplot(x, y, 'sigmoid')

## sigmoid函数的导数, 当输入为0, sigmoid函数的导数达到最大值0.25
with tf.GradientTape() as t:
    t.watch(x)
    y=y = tf.nn.sigmoid(x)
dy_dx = t.gradient(y, x)
xyplot(x, dy_dx, 'grad of sigmoid')

激活函数三: tanh函数

tanh函数可以将元素的值变换到-1~1之间:
在这里插入图片描述

## tf.nn 提供tanh函数
y = tf.nn.tanh(x)
xyplot(x, y, 'tanh')

## tanh函数的导数, 当输入为0, tanh函数的导数达到最大值1;
with tf.GradientTape() as t:
    t.watch(x)
    y=y = tf.nn.tanh(x)
dy_dx = t.gradient(y, x)
xyplot(x, dy_dx, 'grad of tanh')