【DataWhale-李宏毅深度学习】Task04深度学习介绍和反向传播机制

最新推荐文章于 2022-06-28 17:05:56 发布

LucyFang2020

最新推荐文章于 2022-06-28 17:05:56 发布

阅读量173

点赞数

文章标签：深度学习

本文链接：https://blog.csdn.net/LucyLuo2020/article/details/118759966

版权

参考链接：https://datawhalechina.github.io/leeml-notes

文章目录

一、深度学习的发展趋势
二、深度学习的三个步骤
三、反向传播
四、总结

一、深度学习的发展趋势

回顾一下深度学习（deep learning）的历史：

1958: Perceptron (linear model)
1969: Perceptron has limitation
1980s: Multi-layer perceptron
- Do not have significant difference from DNN today
1986: Backpropagation
- Usually more than 3 hidden layers is not helpful
1989: 1 hidden layer is “good enough”, why deep?
2006: RBM initialization (breakthrough)
2009: GPU
2011: Start to be popular in speech recognition
2012: win ILSVRC image competition

感知机（Perceptron）非常像我们的逻辑回归（Logistics Regression）只不过是没有sigmoid激活函数。09年的GPU的发展是很关键的，使用GPU矩阵运算节省了很多的时间。

二、深度学习的三个步骤

在这里插入图片描述

Step1：神经网络（Neural network）
Step2：模型评估（Goodness of function）
Step3：选择最优函数（Pick best function）

2.1 神经网络（Neural network）

在这里插入图片描述
神经网络（Neural network）里面的节点，类似我们的神经元。神经网络也可以有很多不同的连接方式，这样就会产生不同的结构（structure）在这个神经网络里面，我们有很多逻辑回归函数，其中每个逻辑回归都有自己的权重和自己的偏差，这些权重和偏差就是参数。

2.2 模型评估（Goodness of function）

损失示例：
在这里插入图片描述
对于模型的评估，我们一般采用损失函数来反应模型的好差，所以对于神经网络来说，采用交叉熵（cross entropy）函数来对 $y$ 和 $\hat{y}$ 的损失进行计算。
总体损失：

对于损失，我们不单单要计算一笔数据的，而是要计算整体所有训练数据的损失，然后把所有的训练数据的损失都加起来，得到一个总体损失L。

2.3 选择最优函数（Pick best function）

我们使用梯度下降法去找最优函数和最好的一组参数。
在这里插入图片描述

三、反向传播

1.损失函数(Loss function)是定义在单个训练样本上的，也就是就算一个样本的误差，比如我们想要分类，就是预测的类别和实际类别的区别，是一个样本的，用L表示。
2.代价函数(Cost function)是定义在整个训练集上面的，也就是所有样本的误差的总和的平均，也就是损失函数的总和的平均，有没有这个平均其实不会影响最后的参数的求解结果。
3.总体损失函数(Total loss function)是定义在整个训练集上面的，也就是所有样本的误差的总和。也就是平时我们反向传播需要最小化的值。

四、总结

通过本节的学习，我学会了：

1.深度学习的来由
2.深度学习的步骤
3.反向传播的基础知识

LucyFang2020

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
【DataWhale-李宏毅深度学习】Task04深度学习介绍和反向传播机制

参考链接：https://datawhalechina.github.io/leeml-notes文章目录一、深度学习的发展趋势二、深度学习的三个步骤2.1 神经网络（Neural network）2.2 模型评估（Goodness of function）2.3 选择最优函数（Pick best function）三、反向传播四、总结一、深度学习的发展趋势回顾一下深度学习（deep learning）的历史：1958: Perceptron (linear model)1969: Percep
复制链接

扫一扫