AlphaGo Zero:笔记与伪代码

近日,Google DeepMind 在 Nature 上发表了一篇论文,介绍了这家世界顶级人工智能机构在计算机围棋方面的最新研究成果 AlphaGo Zero(参阅机器之心文章《 无需人类知识,DeepMind 新一代围棋程序 AlphaGo Zero 再次登上 Nature》)。这个在学习过程中没有使用任何人类知识的人工智能程序可以轻松地以 100 比 0 的成绩击败去年 3 月战胜了李世乭的 AlphaGo 版本。AlphaGo Zero 论文发布之后,阿尔伯塔大学 Yuxi Li 博士对该程序的工作原理进行了分析,并使用伪代码的方式对其训练过程进行了描述。原文链接请参见 https://pan.baidu.com/s/1jI481xW

 

1 引言

 

2016 年 3 月,AlphaGo(Silver et al., 2016)击败了带有 18 个国际冠军头衔的人类顶级围棋手,造就了人工智能领域的一大里程碑。AlphaGo Zero(Silver et al., 2017)则实现了更进一步的提升,在不使用人类知识的情况下学习到了一个超人水平的计算机围棋程序。


AlphaGo(Silver et al., 2016; 2017)立足于深度学习、强化学习(RL)和蒙特卡洛树搜索(MCTS)。这一波深度强化学习浪潮起始于深度 Q 学习(Mnih et al., 2015);全面概述请参阅 Li (2017) https://arxiv.org/abs/1701.07274。

 

Sutton 和 Barto (2017) 对 AlphaGo 进行了详细且直观的描述。关于 AlphaGo

  • 0
    点赞
  • 14
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值