Normalize 后使用 Scale 的原因

最新推荐文章于 2023-07-07 12:25:10 发布

NineDays66

最新推荐文章于 2023-07-07 12:25:10 发布

阅读量1.1k

点赞数 1

分类专栏：机器学习、深度学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u011808673/article/details/82250930

版权

机器学习、深度学习专栏收录该内容

99 篇文章 19 订阅

订阅专栏

特征归一化的重要性

从最新方法来看，权值W和特征f(或x)归一化已经成为了标配，而且都给归一化特征乘以尺度因子s进行放大，目前主流都采用固定尺度因子s的方法(看来自适应训练没那么重要)；
权值和特征归一化使得CNN更加集中在优化夹角上，得到的深度人脸特征更加分离；
特征归一化后，特征向量都固定映射到半径为1的超球上，便于理解和优化；但这样也会压缩特征表达的空间；乘尺度因子s，相当于将超球的半径放大到s，超球变大，特征表达的空间也更大（简单理解：半径越大球的表面积越大）；
特征归一化后，人脸识别计算特征向量相似度，L2距离和cos距离意义等价，计算量也相同，我们再也不用纠结到底用L2距离还会用cos距离：

为什么仅特征归一化无法收敛，而必须乘固定尺度因子呢？以四分类为例分析。

仅特征归一化时，输出 $\left\{ x_{1}, x_{2}, x_{3}, x_{4} \right\}$ 等价于 $\left\{ cos(\theta), x_{2}, x_{3}, x_{4} \right\}$ ，理想情况下，优后 $\theta$ 是0，x2=x3=x4都输出0，此时激活值为{1, 0, 0, 0}，指数函数非线性放大后输出为{e, 1, 1, 1}，归一化后置信度是{47.54%, 17.49%, 17.49%, 17.49%}，远远达不到收敛的要求，所以仅归一化是不能训练的。
归一化后乘尺度因子s，这里以s=60为例，输出 $\left\{ x_{1}, x_{2}, x_{3}, x_{4} \right\}$ 等价于 $\left\{ 60\cdot cos(\theta), x_{2}, x_{3}, x_{4} \right\}$ ，理想情况下，优后 $\theta$ 是0，x2=x3=x4都输出0，此时激活值为{60, 0, 0, 0}，指数函数非线性放大后输出为{exp(60), 1, 1, 1}，归一化后置信度是{100%, 0%, 0%, 0%}，完全可以达到收敛要求。所以特征归一化必须乘尺度因子。

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

NineDays66 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。