DRL(八)—— Monte Carlo Tree Search (MCTS)

本文介绍了离散环境下的一种规划方法——Monte Carlo Tree Search (MCTS),它通过树状结构进行搜索。MCTS的选择策略结合了高奖励动作和未探索动作,并通过特定的分数公式来平衡这两者。文章还探讨了MCTS如何在不同状态下选择动作,并提到了相关论文供进一步研究。
摘要由CSDN通过智能技术生成

一个比较有意思的在离散情况下的 planning 方式。

之所以叫做tree search,我觉得就是因为这种方法就是像树杈一样从根部到树叶不断地搜索。就像下图这样:
在这里插入图片描述
要注意的是:

  • 每个节点的含义,并不是每个state,而是采取某个特定的action后到达的state,这个state可以是不同的。比如说,从 s 1 s_1 s1开始,我们如果执行action a 1   =   0 a_1~=~0 a1 = 0,如图所示就会到达左边的 s 2 s_2 s2,只要执行action
  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值