强化学习《基于策略 - PPO,TRPO,PPO2》

在上一篇博客最后,我们说到了θ和θ^k是不能差太多的,不然结果会不好,那么怎么避免它们差太多呢?
这就是这一篇要介绍的PPO所在做的事情。

1:PPO1算法:

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
2:TRPO算法
在这里插入图片描述
3:PPO2算法
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

已标记关键词 清除标记
©️2020 CSDN 皮肤主题: 1024 设计师:上身试试 返回首页