2022.4.17第二次周报-CSDN博客

本文链接：https://blog.csdn.net/weixin_43971717/article/details/124230420

这篇博客回顾了深度学习的发展历程，从1958年的感知机到2012年在ILSVRC图像竞赛中的突破。重点讨论了反向传播在神经网络中的作用，以及损失函数和代价函数的区别。同时强调了GPU在加速计算中的重要性，并概述了机器学习的三个主要步骤：神经网络、模型评估和选择最优函数。

摘要由CSDN通过智能技术生成

回顾一下deep learning的历史：

1958: Perceptron (linear model)
1969: Perceptron has limitation
1980s: Multi-layer perceptron
- Do not have significant difference from DNN today
1986: Backpropagation
- Usually more than 3 hidden layers is not helpful
1989: 1 hidden layer is “good enough”, why deep?
2006: RBM initialization (breakthrough)
2009: GPU
2011: Start to be popular in speech recognition
2012: win ILSVRC image competition 感知机（Perceptron）非常像我们的逻辑回归（Logistics Regression）只不过是没有sigmoid激活函数。09年的GPU的发展是很关键的，使用GPU矩阵运算节省了很多的时间。

我们都知道机器学习有三个step，对于deep learning其实也是3个步骤：

Step1：神经网络（Neural network）
Step2：模型评估（Goodness of function）
Step3：选择最优函数（Pick best function）

在神经网络中计算损失最好的方法就是反向传播，我们可以用很多框架来进行计算损失，比如说TensorFlow，theano，Pytorch等等。

反向传播：

损失函数(Loss function)是定义在单个训练样本上的，也就是就算一个样本的误差，比如我们想要分类，就是预测的类别和实际类别的区别，是一个样本的，用L表示。
代价函数(Cost function)是定义在整个训练集上面的，也就是所有样本的误差的总和的平均，也就是损失函数的总和的平均，有没有这个平均其实不会影响最后的参数的求解结果。
总体损失函数(Total loss function)是定义在整个训练集上面的，也就是所有样本的误差的总和。也就是平时我们反向传播需要最小化的值。

总的来说，我们的目标是要求计算 $\frac{\partial z}{\partial w}$ （Forward pass）和计算 $\frac{\partial l}{\partial z}$ ( Backward pass)，然后把 $\frac{\partial z}{\partial w}$ $\frac{\partial l}{\partial z}$ 相乘，我们就可以得到 $\frac{\partial l }{\partial w}$ ,所有我们就可以得到神经网络中所有的参数，然后用梯度下降就可以不断更新，得到损失最小的函数