- 博客(1)
- 收藏
- 关注
原创 关于DQN中的疑惑
我有个问题想请教,DQN中,在初始化阶段Q function 和 Target network输出都是随机的,那么减少这两个随机输出的误差为什么能update出一个好的policy,是reward起的作用吗,如果是reward引导q值往正确的方向update,那即使是过估计,reward应该也能纠正过来?实在想不明白,望解答 ...
2018-11-22 22:24:02 1061 3
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人