dqn 应用案例_强化学习(十二) Dueling DQN

最新推荐文章于 2025-03-13 16:01:27 发布

Thomas Talhelm

最新推荐文章于 2025-03-13 16:01:27 发布

阅读量763

点赞数

文章标签： dqn 应用案例

本文链接：https://blog.csdn.net/weixin_33404412/article/details/111964521

版权

本文介绍了Dueling DQN，一种强化学习中的优化方法，通过将Q网络分为价值函数和优势函数两部分来改进算法。价值函数与状态相关，优势函数与状态和动作相关。Dueling DQN的网络结构包含这两个子网络，并通过中心化处理优势函数以增强可辨识性。文章以CartPole-v0游戏为例展示了Dueling DQN的应用，并提供了实现代码。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

在强化学习(十一) Prioritized Replay DQN中，我们讨论了对DQN的经验回放池按权重采样来优化DQN算法的方法，本文讨论另一种优化方法，Dueling DQN。本章内容主要参考了ICML 2016的deep RL tutorial和Dueling DQN的论文(ICML 2016)。

1. Dueling DQN的优化点考虑

在前面讲到的DDQN中，我们通过优化目标Q值的计算来优化算法，在Prioritized Replay DQN中，我们通过优化经验回放池按权重采样来优化算法。而在Dueling DQN中，我们尝试通过优化神经网络的结构来优化算法。

具体如何优化网络结构呢？Dueling DQN考虑将Q网络分成两部分，第一部分是仅仅与状态$S$有关，与具体要采用的动作$A$无关，这部分我们叫做价值函数部分，记做$V(S,w,\alpha)$,第二部分同时与状态状态$S$和动作$A$有关，这部分叫做优势函数(Advantage Function)部分,记为$A(S,A,w,\beta)$,那么最终我们的价值函数可以重新表示为：$$Q(S,A, w, \alpha, \beta) = V(S,w,\alpha) + A(S,A,w,\beta)$$

其中，$w$是公共部分的网络参数，而$\alpha$是价值函数独有部分的网络参数，而$\beta$是优势函数独有部分的网络参数。

2. Dueling DQN网络结构

由于Q网络的价值函数被分为两部分，因此Dueling DQN的网络结构也和之前的DQN不同。为了简化算法描述，这里不使用原论文的CNN网络结构，而是使用前面文中用到的最简单的三层神经网络来描述。是否使用CNN对Dueling DQN算法本身无影响。

在前面