强化学习和监督学习的一些区别

最新推荐文章于 2024-01-25 13:08:45 发布

life1024

最新推荐文章于 2024-01-25 13:08:45 发布

阅读量7.5k

点赞数 1

分类专栏：机器学习及相关算法

版权声明：本文为博主原创文章，遵循 CC 4.0 BY 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u013378306/article/details/68059126

版权

机器学习及相关算法专栏收录该内容

92 篇文章 42 订阅 ¥49.90 ¥99.00

订阅专栏

本文比较了强化学习和监督学习的差异。强化学习中，agent通过探索环境并根据状态选择行动，得到的奖励仅作为分数，而监督学习则提供明确的正确/错误标签。在未充分探索和行动次数不足的情况下，强化学习难以评估期望效果，但在面对有噪声的标签信息或主动学习获取的标签时，强化学习的交互反馈更可靠。

摘要由CSDN通过智能技术生成

强化学习要求agent去探索环境，然后对状态进行evaluate，在每一个状态下agent可以选择多种action，每次选择的依据可以是贪婪或者softmax等，但是得到的reward是无法表明当前的选择是正确的还是错误的，得到的只是一个score，监督学习的labels可以给agent简洁明了的correct or wrong，并且在agent 在对环境充分的探索前即在每一种状态下选择的每个action的次数不够多时，无法充分求expect，并且在action之间也无法进行对比择优。但是当监督学习的label信息有噪声干扰或者是利用一些active learning 获得到的labels的时候，强化学习的agent与环境直接交互获取到的信息是更加可靠。

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

life1024 你的鼓励将是我创作的最大动力。

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。