强化学习打卡之DQN与Actor-Critic

深度理解强化学习：DQN与Actor-Critic

最新推荐文章于 2025-08-14 14:17:23 发布

原创

最新推荐文章于 2025-08-14 14:17:23 发布 · 2.9k 阅读

2 ·

CC 4.0 BY-SA版权

本文探讨了强化学习中的DQN方法，它通过神经网络解决Q-learning在大动作空间的问题。接着对比了MC和TD的学习方式，并讨论了Q函数的两种表达形式。文章还提到了DQN训练的三个关键技巧：目标网络、探索策略和经验回放缓冲区。此外，介绍了Actor-Critic算法，它是策略梯度和TD学习的结合，同时讨论了其在估计Q和V网络时的挑战及解决方案。最后，简述了A3C算法用于加速策略梯度计算的方法。

强化学习打卡之DQN

DQN为了解决动作空间过大造成维数灾难问题在Q-learning的基础上引入了神经网络。DQN 主要是把 Q 函数通过价值函数近似方法转换为一个深度神经网络。神经网络输入的是状态，输出每个动作的Q值。

前面学过Q-learning 是一种value-based的方法，不是学习策略，而是说有一个critic通过MC based的方法或者TD based的方法得出状态值函数 V π（s）进行 Policy Evaluation(策略评估)。

MC VS.TD

在这里插入图片描述由上图MC和TD的更新公式可知两者各有优劣，MC是一个episode得到的累计奖励值，所以偏差较大，但是方差较大；而TD是每走一步就learn一下，更新的公式中的r是个随机量，会可能带来大的估计偏差，但是方差较小。

Q function

1.第一种写法：input 是 state 跟 action，output 就是一个 scalar
2.第二种写法：input 是一个 state s，output 就是好几个 value（仅对离散的action）
在这里插入图片描述上图说明了Q-learning本质的问题是要找到一个策略π使得Q函数能取到最大值，而这个策略是用Q function推出

最低0.47元/天解锁文章