第四章:多智能体强化学习(MARL)

涵盖并行计算、多智能体系统设定(合作、竞争、混合)、MAC-A2C、MAN-A2C、MADDPG 及注意力机制在 MARL 中的应用。

多智能体强化学习

并行计算

并行计算需要在计算机集群上完成。 MapReduce 属于 client-server 架构,由一个中央服务器节点控制多个 worker 节点。

  • 通信模式

    • 广播 (Broadcast):服务器将同一条信息同时发送给所有 worker 节点。
    • 映射 (Map):所有 worker 节点同时并行做计算。
    • 规约 (Reduce):把 worker 节点上的计算数据归并传输回服务器。
  • 并行模式

    • 数据并发 (Data Parallelism):数据集划分到 mm 个 worker 节点上,每个节点存一部分数据。
    • 模型并发 (Model Parallelism):模型参数 ω\omega 划分到 mm 个 worker 节点上,每个节点有全部数据。
  • 关键指标与瓶颈

    • 加速比 (Speedup ratio)单节点钟表时间m 个节点钟表时间\frac{\text{单节点钟表时间}}{\text{m 个节点钟表时间}}
    • 通信时间通信量带宽+延迟\approx \frac{\text{通信量}}{\text{带宽}} + \text{延迟}
    • 同步算法 (Synchronous):每一轮等待所有节点完成,受限于掉队者效应(Straggler effect)。
    • 异步算法 (Asynchronous):worker 节点完成计算后立即与 server 通信,无需等待其他节点,资源利用率高,虽然单位样本收敛步数较多,但实际钟表时间明显更快。

异步并行双 Q 学习流程

服务器与 worker 节点均存储 DQN 参数。第 kk 号 worker 节点重复执行以下步骤:

  1. 请求参数:向服务器索要最新 DQN 参数 ωnew\omega_{\text{new}}
  2. 更新目标网络ωnewτωnew+(1τ)ωnow\omega_{\text{new}}^- \leftarrow \tau \cdot \omega_{\text{new}} + (1 - \tau)\cdot \omega_{\text{now}}^-
  3. 经验回放与计算梯度
    • 从本地经验回放数组中随机抽取 bb 个四元组 (sj,aj,rj,sj)(s_j, a_j, r_j, s_j')
    • 用双 Q 学习计算 TD 目标: y^j=rj+γQ(sj,aj;ωnew),其中 aj=argmaxaQ(sj,a;ωnew)\hat y_j = r_j + \gamma \cdot Q(s_j', a_j'; \omega_{\text{new}}^-), \quad \text{其中 } a_j' = \arg \max_a Q(s_j', a; \omega_{\text{new}})
    • 定义损失函数: L(ω)=12bj=1b[Q(sj,aj;ω)y^j]2L(\omega) = \frac{1}{2b}\sum_{j=1}^b [Q(s_j, a_j; \omega) - \hat y_j]^2
    • 计算梯度:g~k=ωL(ωnew)\tilde g^k = \nabla_{\omega} L(\omega_{\text{new}})
  4. 推送梯度:将梯度 g~k\tilde g^k 发送给服务器更新全局参数。

多智能体系统 (MAS)

多智能体系统(multi-agent system,MAS)中存在 mm 个智能体共享环境并相互影响。

常见的四种博弈设定

  1. 完全合作关系 (Fully Cooperative):所有智能体利益一致,获得的奖励相同。
  2. 完全竞争关系 (Fully Competitive):一方的收益即另一方的损失(零和博弈)。
  3. 合作与竞争混合 (Mixed Cooperative & Competitive):组内合作、组间竞争。
  4. 利己主义 (Self-interested):智能体仅关注最大化自身收益。

多智能体系统的联合状态价值函数表示为:

Vπi(s)=EA[Qπi(s,A)]=a1A1amAmπ(as;θ1,,θm)Qπi(s,a)V_{\pi}^i(s) = \mathbb{E}_A[Q_{\pi}^i(s,A)] = \sum_{a^1 \in \mathcal{A}^1} \cdots \sum_{a^m \in \mathcal{A}^m} \pi(a\mid s;\theta^1, \cdots,\theta^m)\cdot Q_{\pi}^i(s,a)


合作关系设定下的 MARL

全局状态假设为所有局部观测的集合 S=[O1,O2,,Om]S = [O^1, O^2, \cdots, O^m]。在完全合作设定下,所有智能体共享同一个团队回报与价值函数 QπQ_\pi

MARL 完全合作关系设定下的符号

MAC-A2C 策略梯度定理

设基线 b=Vπ(s)b = V_\pi(s),第 ii 个智能体的策略梯度估计为:

g~i(st,at;θi)(rt+γv(st+1;ω)v(st;ω))θilnπ(atist;θi)\tilde g^i (s_t,a_t;\theta^i) \triangleq \left( r_t + \gamma\cdot v(s_{t+1};\omega)-v(s_t;\omega) \right) \cdot \nabla_{\theta^i} \ln \pi (a_t^i \mid s_t; \theta^i)

三种常见系统架构

  • ### 中心化训练 + 中心化决策 (CTCD) 价值网络与策略网络均运行在中央控制器(Central Controller)上,智能体仅上传观测并执行指令。

  • ### 去中心化训练 + 去中心化决策 (DTDD) 每个智能体独立运行各自的价值网络和策略网络,等价于 mm 个独立的单智能体强化学习(SARL)。

  • ### 中心化训练 + 去中心化决策 (CTDE) 训练阶段在中央控制器上利用全局状态 SS 训练价值网络并计算 TD 误差;决策阶段策略网络仅依赖局部观测 OiO^i 独立推断,不再依赖中央控制器。


非合作关系设定下的 MARL

非合作设定下,第 ii 号智能体的目标函数为 Ji(θ1,,θm)=ES[Vπi(S)]J^i(\theta^1, \cdots, \theta^m) = \mathbb{E}_S [V_{\pi}^i(S)]。评估标准为纳什均衡(Nash Equilibrium)

MAN-A2C 与 MADDPG

  • MAN-A2C:中心化训练阶段“上帝视角”中央控制器可观察所有智能体的状态 s=[o1,,om]s = [o^1, \dots, o^m],各个智能体拥有独立的价值网络 v(s;ωi)v(s; \omega^i)
  • MADDPG:适用于连续控制的 CTDE 架构,每个智能体的价值网络 q(s,a1,,am;ωi)q(s, a_1, \dots, a_m; \omega^i) 输入所有智能体的动作与全局状态。
MADDPG 的三项优化技巧
  1. 结合 TD3 技巧:使用截断双 Q 学习、目标动作平滑噪声与延迟策略更新。
  2. 结合 RNN:在策略与价值网络中加入记忆机制以应对不完全观测。
  3. 结合注意力机制:处理可变数量智能体。

注意力机制与 MARL

传统拼接局部观测 [o1,,om][o^1, \dots, o^m] 作为价值网络输入存在缺点:智能体数量 mm 变大时参数量暴增,且无法灵活处理智能体动态加入/离开。

引入自注意力机制(Self-Attention)

  • 输入序列 (x1,,xm)(x^1, \dots, x^m) 输出对应上下文表示 (c1,,cm)(c^1, \dots, c^m)
  • 网络参数量与智能体数量 mm 解耦。
  • 在大型多智能体场景中能显著提升协同表现与泛化能力。