强化学习通俗介绍

最新推荐文章于 2022-01-11 21:08:04 发布

胶囊一号

最新推荐文章于 2022-01-11 21:08:04 发布

阅读量1.2k

点赞数

分类专栏：强化学习系列文章标签：强化学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/s291174225/article/details/105357770

版权

什么是强化学习

RL 采用动态环境数据。其目标并不是对数据进行分类或标注，而是确定生成最优结果的最佳动作序列。为了解决这个问题，强化学习通过一个软件（即所谓的代理）来探索环境、与环境交互并从环境中学习。
图解：
在这里插入图片描述

剖析强化学习

代理中有一个函数可接收状态观测量（输入），并将其映射到动作集（输出）。也就是前面讨论过的单一函数，它将取代控制系统的所有独立子组件。在 RL 命名法中，此函数称之为策略。策略根据一组给定的观测量决定要采取的动作。
在这里插入图片描述
举例
以步行机器人为例，观察结果是指每个关节的角度、机器人躯干的加速度和角速度，以及视觉传感器采集的成千上万个像素点。策略将根据所有这些观测量，输出电机指令，使机器人移动四肢。接着，环境将生成奖励，向代理反映特定作动器指令组合的效果。如果机器人能够保持直立并继续行走，则对应的奖励将高于机器人摔倒时的。
在这里插入图片描述

学习最优策略

它可以根据已采取的动作、环境状态观测量以及获得的奖励值来改变策略。

最低0.47元/天解锁文章

关注

0
点赞
踩
6

收藏

觉得还不错? 一键收藏
0
评论
强化学习通俗介绍

什么是强化学习RL 采用动态环境数据。其目标并不是对数据进行分类或标注，而是确定生成最优结果的最佳动作序列。为了解决这个问题，强化学习通过一个软件（即所谓的代理）来探索环境、与环境交互并从环境中学习。图解：剖析强化学习代理中有一个函数可接收状态观测量（输入），并将其映射到动作集（输出）。也就是前面讨论过的单一函数，它将取代控制系统的所有独立子组件。在 RL 命名法中，此函数称之为策略。策...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。