07MARL经典算法 Policy-Based Learning


前言

MARL基础算法第三类基于策略的学习


一、基于策略方法的提出

目前为止方法总体就是评估价值函数,基于价值函数更新策略,这些方法都具有一定的限制,如JAL-SG不能有效收敛到均衡状态,而虚拟博弈不能收敛到随机策略分布的情况,因此基于策略的方法提出,利用数据直接优化联合策略。

二、普遍的梯度上升的更新方法

首先根据智能体i的策略采取对智能体j的动作后得到的效益函数
U i ( π i , a j ) = ∑ a i ∈ A i π i ( a i ) R i ( a i , a j ) . \begin{aligned}U_i(\pi_i,a_j)&=\sum_{a_i\in A_i}\pi_i(a_i)\mathcal{R}_i(a_i,a_j).\end{aligned} Ui(πi,aj)=aiAiπi(ai)Ri(ai,aj).
针对 π i \pi_i πi求偏导
在这里插入图片描述
根据第k轮episode当中的策略以及其他智能体采取的动作进行更新
在这里插入图片描述
更新的第一步是无约束的梯度上升,通过投影算子将更新后的策略投影到有效的空间内
其中, P ( x ) = arg ⁡ min ⁡ x ′ ∈ Δ ( A i ) ∣ ∣ x − x ′ ∣ ∣ P(x)=\arg\min_{x^{\prime}\in\Delta(A_i)}||x-x^{\prime}|| P(x)=argminxΔ(Ai)∣∣xx∣∣

  • 23
    点赞
  • 19
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值