强化学习《未完待续》

讲解Q-Learning和Sarsa 之间的区别: https://blog.csdn.net/u010223750/article/details/78955807

(这篇是上述连接的补充:https://blog.csdn.net/qq_39004117/article/details/81705845    还没看完,,,,,)

Q-learning算法则是一个off-policy的方法,其原始策略和值函数更新策略不一致,同样的也不需要进行采样一个轨迹进行策略更新。

和Sarsa算法不一样的是,Q-learning在更新值函数的时候使用的是贪心策略,而不是ϵ-greedy策略。

 

 

强化学习中on-policy 与off-policy有什么区别?https://www.zhihu.com/question/57159315

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值