MADDPG的架构

MADDPG采用的是“中心化训练+去中心化决策”的架构,是一种Actor-Critic方法。其中每个智能体都有一个价值网络和策略网络。

价值网络和策略网络
  1. 第i号价值网络(Critic)
    输入:全局状态s、所有智能体的动作a(因为需要结合队友、对手的观测及动作才知道自身当前的动作好不好)
    输出:一个实数(表示基于全局状态s,第i号智能体执行动作ai的好坏程度,可以指导第i号策略网络作出改进)
    训练方式:TD算法

训练第i号价值网络需要用四元组<st、at、rt、st+1>,
在这里插入图片描述
在这里插入图片描述
具体来说用到了:
t时刻的奖励;(输出ri)
所有智能体的策略网络;(输出所有智能体的a)
下一时刻的全局状态St+1;(输出St+1)
以及第i号智能体的价值网络;(输出i智能体Critic的预测值)

  1. 第i号策略网络(Actor)
    输入:第i号智能体的观测 oi
    输出:第i号智能体的动作 ai
    训练方式:DPG(Deterministic Policy Gradient)
    训练时不需要直接使用四元组 <st, at, rt, st+1>,而是利用当前全局状态 st 和所有智能体的策略网络,通过第i号价值网络计算梯度来更新策略。
    具体来说:根据当前状态 s,所有智能体的策略网络输出动作 a,然后用第i号价值网络 Qi(s, a) 对 ai 求偏导,再通过链式法则更新策略网络参数 θi。
    在这里插入图片描述所有智能体的策略网络与第i号智能体的价值网络
    在这里插入图片描述
Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐