第四章:多智能体强化学习(MARL)
涵盖并行计算、多智能体系统设定(合作、竞争、混合)、MAC-A2C、MAN-A2C、MADDPG 及注意力机制在 MARL 中的应用。
多智能体强化学习
并行计算
并行计算需要在计算机集群上完成。 MapReduce 属于 client-server 架构,由一个中央服务器节点控制多个 worker 节点。
-
通信模式:
- 广播 (Broadcast):服务器将同一条信息同时发送给所有 worker 节点。
- 映射 (Map):所有 worker 节点同时并行做计算。
- 规约 (Reduce):把 worker 节点上的计算数据归并传输回服务器。
-
并行模式:
- 数据并发 (Data Parallelism):数据集划分到 个 worker 节点上,每个节点存一部分数据。
- 模型并发 (Model Parallelism):模型参数 划分到 个 worker 节点上,每个节点有全部数据。
-
关键指标与瓶颈:
- 加速比 (Speedup ratio):
- 通信时间:
- 同步算法 (Synchronous):每一轮等待所有节点完成,受限于掉队者效应(Straggler effect)。
- 异步算法 (Asynchronous):worker 节点完成计算后立即与 server 通信,无需等待其他节点,资源利用率高,虽然单位样本收敛步数较多,但实际钟表时间明显更快。
异步并行双 Q 学习流程
服务器与 worker 节点均存储 DQN 参数。第 号 worker 节点重复执行以下步骤:
- 请求参数:向服务器索要最新 DQN 参数 。
- 更新目标网络:
- 经验回放与计算梯度:
- 从本地经验回放数组中随机抽取 个四元组
- 用双 Q 学习计算 TD 目标:
- 定义损失函数:
- 计算梯度:
- 推送梯度:将梯度 发送给服务器更新全局参数。
多智能体系统 (MAS)
多智能体系统(multi-agent system,MAS)中存在 个智能体共享环境并相互影响。
常见的四种博弈设定
- 完全合作关系 (Fully Cooperative):所有智能体利益一致,获得的奖励相同。
- 完全竞争关系 (Fully Competitive):一方的收益即另一方的损失(零和博弈)。
- 合作与竞争混合 (Mixed Cooperative & Competitive):组内合作、组间竞争。
- 利己主义 (Self-interested):智能体仅关注最大化自身收益。
多智能体系统的联合状态价值函数表示为:
合作关系设定下的 MARL
全局状态假设为所有局部观测的集合 。在完全合作设定下,所有智能体共享同一个团队回报与价值函数 。
MAC-A2C 策略梯度定理
设基线 ,第 个智能体的策略梯度估计为:
三种常见系统架构
-
### 中心化训练 + 中心化决策 (CTCD) 价值网络与策略网络均运行在中央控制器(Central Controller)上,智能体仅上传观测并执行指令。
-
### 去中心化训练 + 去中心化决策 (DTDD) 每个智能体独立运行各自的价值网络和策略网络,等价于 个独立的单智能体强化学习(SARL)。
-
### 中心化训练 + 去中心化决策 (CTDE) 训练阶段在中央控制器上利用全局状态 训练价值网络并计算 TD 误差;决策阶段策略网络仅依赖局部观测 独立推断,不再依赖中央控制器。
非合作关系设定下的 MARL
非合作设定下,第 号智能体的目标函数为 。评估标准为纳什均衡(Nash Equilibrium)。
MAN-A2C 与 MADDPG
- MAN-A2C:中心化训练阶段“上帝视角”中央控制器可观察所有智能体的状态 ,各个智能体拥有独立的价值网络 。
- MADDPG:适用于连续控制的 CTDE 架构,每个智能体的价值网络 输入所有智能体的动作与全局状态。
MADDPG 的三项优化技巧
- 结合 TD3 技巧:使用截断双 Q 学习、目标动作平滑噪声与延迟策略更新。
- 结合 RNN:在策略与价值网络中加入记忆机制以应对不完全观测。
- 结合注意力机制:处理可变数量智能体。
注意力机制与 MARL
传统拼接局部观测 作为价值网络输入存在缺点:智能体数量 变大时参数量暴增,且无法灵活处理智能体动态加入/离开。
引入自注意力机制(Self-Attention):
- 输入序列 输出对应上下文表示 。
- 网络参数量与智能体数量 解耦。
- 在大型多智能体场景中能显著提升协同表现与泛化能力。