深度强化学习系列 - J.Q.Wang (DeepRL)

深度强化学习系列(1): 深度强化学习概述

深度强化学习系列(2): ERROR: GLEW initalization error: Missing GL version

深度强化学习系列(3): 无

深度强化学习系列(4): Q-Learning原理与实现

深度强化学习系列(5): Double Q-Learning原理详解

深度强化学习系列(6): DQN原理及实现

深度强化学习系列(7): Double DQN(DDQN)原理及实现

深度强化学习系列(8): Prioritized Experience Replay(PER-DQN)原理及实现

深度强化学习系列(9): Dueling DQN(DDQN)原理及实现 

深度强化学习系列(10): NoisyNet-DQN原理及实现

深度强化学习系列(11): 无

深度强化学习系列(12): 无

深度强化学习系列(13): 策略梯度(Policy Gradient)

深度强化学习系列(14): A3C算法原理及Tensorflow实现

深度强化学习系列(15): TRPO算法原理及Tensorflow实现

深度强化学习系列(16): 从DPG到DDPG算法的原理讲解及tensorflow代码实现

 

相关:

深度强化学习系列: OpenAI-baselines的使用方法

深度强化学习系列: 最全深度强化学习资料

深度强化学习系列: 深度强化学习实验中应该使用多少个随机种子?

深度强化学习系列: “超参数”与“网络结构”自动化设置方法---DeepHyper

深度强化学习系列: 深度强化学习的加速方法解读

深度强化学习系列: 多巴胺(Dopamine)环境配置和实例分析

深度强化学习系列: “奖励函数”的设计和设置(reward shaping)

 

参考文献:

1. 深度强化学习(DeepRL)探索博客_J.Q.Wang2011_CSDN博客 https://blog.csdn.net/gsww404

2. 深度强化学习系列_J.Q.Wang2011-CSDN博客 https://blog.csdn.net/gsww404/category_9273243.html

 

  • 1
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值