强化学习实践三：编写通用的格子世界环境类

最新推荐文章于 2024-06-09 09:41:57 发布

xyk_hust

最新推荐文章于 2024-06-09 09:41:57 发布

阅读量3.3k

点赞数 4

分类专栏：强化学习实践强化学习实践文章标签：强化学习格子世界 gym 环境

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xyk_hust/article/details/86569776

版权

本文介绍了一个通用的格子世界环境类，适用于模拟David Silver强化学习公开课中的简单格子、悬崖行走等场景。该环境允许用户自定义格子的大小、障碍、奖励值和起始、终止状态。通过设置参数并调用相关方法，可以创建特定的格子世界环境，并使用gym库进行进一步操作，如录制个体行动的视频。

摘要由CSDN通过智能技术生成

gym里内置了许多好玩经典的环境用于训练一个更加智能的个体，不过这些环境类绝大多数不能用来实践前五讲的视频内容，主要是由于这些环境类的观测空间的某个维度是连续变量而不是离散变量，这是前五讲内容还未涉及到的知识。为了配合解释David Silver视频公开课提到的一些示例，参考了gym的思想设计了一个通用的格子世界环境类，该环境类的观测空间是一维离散变量，可以很好地模拟其公开课中提到的：简单格子、有风格子、随机行走、悬崖行走、随机策略（骷髅和钱袋子）等问题。在此基础上理解、实践强化学习的基础算法就相对简单而且直观了。

先贴上格子世界环境类的源文件：gridworld.py，只把该文件下载到您自己的文件夹内，导入其中的类或方法就可以了。已经内置的一些环境类UI界面类似下面这些：

一些内置的格子世界环境

简单或有风10*7格子世界

悬崖行走示例

随机行走示例

模仿Gridworld with Dynamic Programming 的一个格子世界

用户可以自定义格子的大小、水平和垂直格子数目、内部障碍分布、以及每一个格子的即时奖励值。在通用的格子世界环境类的UI界面中，我使用不同的颜色设置表示不同的意义&

最低0.47元/天解锁文章

关注

4
点赞
踩
26

收藏

觉得还不错? 一键收藏
6
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论 6

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。