【深度学习】softmax with temperture

sdbhewfoqi

已于 2023-09-22 11:52:17 修改

阅读量3.1k

点赞数 1

分类专栏：深度学习机器学习文章标签：深度学习

于 2022-01-21 15:47:13 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_31866177/article/details/122622795

版权

机器学习同时被 2 个专栏收录

72 篇文章 23 订阅

订阅专栏

62 篇文章 12 订阅

订阅专栏

【机器学习】softmax函数_littlemichelle-CSDN博客

【机器学习】tf.nn.softmax_littlemichelle-CSDN博客

exp 前部分平缓（确定性低），后部分陡峭（确定高），所以softmax添加温度参数。

算是双塔模型的一种优化思路吧。首先上结论，温度高为什么能够避免陷入局部最优解？

如果我们在训练时将t设置比较大，那么预测的概率分布会比较平滑，那么loss会很大，loss大的话，计算出的梯度也越大，参数更新步长较大，能够避免陷入局部最优解。

深度学习中的temperature parameter是什么 - 酱紫啊的文章 - 知乎（直接看原文吧~！）

随着训练的进行，我们将t变小，也可以称作降温，类似于模拟退火算法，这也是为什么要把t称作温度参数的原因。变小模型才能收敛。

问题来源

在google的论文《Sampling-Bias-Corrected Neural Modeling for Large Corpus Item Recommendations》中看到这个公式：

对于这个t很好奇。先简单介绍一下这篇论文，用双塔做推荐，左侧是user特征，右侧是item特征，然后通过DNN之后得到对应向量，再求向量内积得到一个数表示二者相关程度，计算出user和正类item和负类item的相关程度的数值之后，再通过softmax函数，得到user点击每个item的概率值。假设我们有1个正类2个负类，那么我们会将如下向量输入softmax layer：

这里x代表user向量，y代表item向量。一般来说，我们直接求内积就得到了s(x,y)，为什么还要除以t呢？这个t是什么，有什么作用呢？

temperature parameter

这个t叫做温度参数，我们加入到softmax中看看会有什么效果。假设我们处理的是一个三分类问题，模型的输出是一个3维向量：[1,2,3]

然后计算交叉熵损失，首先我们要通过一个softmax layer，softmax公式大家都很熟悉:

我们得到结果：[0.09003057317038046, 0.24472847105479767, 0.6652409557748219]

我们让t=2，其实也就是让[1/2,2/2,3/2]计算softmax，得到结果：

[0.1863237232258476, 0.30719588571849843, 0.506480391055654]

再让t=0.5，让[1/0.5,2/0.5,3/0.5]计算softmax，得到结果：

[0.015876239976466765, 0.11731042782619835, 0.8668133321973348]

看到区别了吗，t越大，结果越平滑，让本来t=1时大的结果变小一点，小的变大一点，得到的概率分布更“平滑”，相应的t越小，得到的概率分布更“尖锐”，这就是t的作用。

观察：随着τ的减小，softmax输出各类别之间的概率差距越大，从而导致loss变小。

如何使用

t的大小和模型最终模型的正确率没有直接关系，我们可以将t的作用类比于学习率。我们的label类似于[1,0,0]，最“尖锐”，如果我们在训练时将t设置比较大，那么预测的概率分布会比较平滑，那么loss会很大，这样可以避免我们陷入局部最优解。随着训练的进行，我们将t变小，也可以称作降温，类似于模拟退火算法，这也是为什么要把t称作温度参数的原因。变小模型才能收敛。比如我们可以这这样设置t:

这里的T表示的是训练循环的次数。

在这篇论文中，设置的是固定的t，并没有进行降温的过程，并且 t=0.05 比较小，我试了一下，loss下降很快。我觉得可能跟使用场景有关，因为这篇文章的label都是[1,0,0]，正类总在第一位。

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
【深度学习】softmax with temperture

无
复制链接

扫一扫

专栏目录

sdbhewfoqi CSDN认证博客专家 CSDN认证企业博客

码龄9年

621: 原创

1万+: 周排名

2148: 总排名

113万+: 访问

: 等级

1万+: 积分

1331: 粉丝

894: 获赞

215: 评论

3422: 收藏

私信

关注

热门文章

分类专栏

最新评论

【深度学习】NLP之Transformer (2) Decoder
wangwz15: 错误理解太多了
【推荐系统】召回离线评估指标Hit Ratio
qq_41321527: 这是recall，不是hit
【计算机视觉】使用ffmpeg抽帧和压缩图片
ChenAllen1025: 写得很详细，菜鸟在这了解了很多概念
【深度学习】GPU版本
穷苦书生_万事愁: 博主的文章对于深度学习中的GPU版本给予了非常深入的探讨，让我在这个领域有了全新的认识。博主的细节描写非常到位，让我感受到了他深厚的专业知识和经验。期待未来能够看到博主持续分享更多这样有价值的文章，同时也希望能够得到博主的指导，共同进步。非常感谢博主的分享和支持！
【机器学习】分值融合方法
CSDN-Ada助手: 推荐 Python入门技能树：https://edu.csdn.net/skill/python?utm_source=AI_act_python

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。