QPLEX 是2021年提出的多智能体强化学习(MARL)价值分解算法,是QMIX的改进与扩展
QPLEXQPLEX: Duplex Value Function Factorization for Multi-Agent Reinforcement Learning是2021年提出的多智能体强化学习MARL价值分解算法是QMIX的改进与扩展。它在保持单调性的同时进一步提升了价值分解的表达能力解决了QMIX在复杂交互场景下的局限性适用于合作型多智能体任务如农业多机器人协同路径规划、任务分配等。1. QMIX的局限性与QPLEX的动机QMIX使用**单调混合网络Monotonic Mixing**将个体Q值非线性组合成全局Q_tot并强制权重非负以保证单调性∂Q_tot/∂Q_i ≥ 0。这带来了良好理论性质但也限制了表达能力无法有效建模负向或复杂非单调交互例如一个智能体动作变好可能暂时降低团队即时价值但长期有益。对全局状态的依赖较强。在高维或异构任务中性能受限。QPLEX核心创新提出双工价值分解Duplex Value Function Factorization将全局Q值分解为两个部分优势部分Advantage捕捉个体对团队的额外贡献非线性、灵活。基线部分Baseline提供稳定、单调的团队价值估计。这种“双路”分解既保留了QMIX的单调性保证又大幅提升了表示能力。2. QPLEX算法原理详解1价值分解公式QPLEX将全局Q值分解为Q_tot(τ, u) V_tot(τ) ∑_i A_i(o_i, a_i) * w_i(τ, u_{-i})更精确的实现形式是Duplex结构全局价值基线Global Value Baseline一个共享的V函数或混合网络提供团队基础价值类似VDN/QMIX的单调部分。个体优势函数Individual Advantage每个智能体输出优势A_i(o_i, a_i) Q_i(o_i, a_i) - V_i(o_i)表示该动作相对于平均动作的额外收益。混合机制使用非线性但可控的混合网络将优势部分与基线组合允许更灵活的交互建模同时通过特定约束如权重归一化或单调激活维持整体单调性。QPLEX的关键是解耦用一个单调混合器处理基线保证稳定性。用另一个灵活混合器可包含负权重或更深网络处理优势部分提升表达力。最终通过加权或门控机制融合两者。2训练过程CTDE范式个体网络每个智能体有独立的Q网络DQN结构输出Q_i(o_i, a_i)。混合网络Mixer输入所有Q_i 全局状态/观测输出Q_tot。损失函数标准TD误差L E[(y - Q_tot(τ, u))^2]其中目标 y r γ max Q_tot(τ’, u’)使用目标网络。额外约束/正则强制或软约束单调性防止分解退化。分散执行每个智能体仍仅基于局部观测贪心选择 argmax Q_i与QMIX一致。3. QPLEX与QMIX的对比方面QMIXQPLEX优势分解方式单调非线性混合双工分解基线 优势更灵活表达能力较强但受单调性限制显著提升可建模复杂/负向交互更好处理真实协同单调性严格强制保留但更松弛平衡理论与性能全局状态依赖较强可优化更鲁棒性能经典基准在多数基准任务上超越QMIX更高上限复杂度中等略高双路网络可接受QPLEX在StarCraft II等基准中表现出色尤其在需要精细协同的任务上。4. 在农业机器人协同中的适用性路径规划机器人学习复杂避让与覆盖协同例如“一机让行、多机补位”QPLEX的优势分解能更好捕捉长期团队收益。任务分配灵活建模异构机器人不同速度/载荷的贡献差异。动态环境田间障碍/故障场景下更好适应非单调交互。实现建议在PyMARL或自定义框架中复现奖励设计中加入覆盖率、能耗、冲突惩罚与通信机制Attention结合进一步提升性能。5. 局限性与后续发展局限网络结构更复杂调参稍难在大规模智能体几十时仍面临维度挑战。后续许多算法在QPLEX基础上继续改进如结合GNN、层次结构、Offline RL。总结QPLEX通过双工价值分解在“单调性保证”与“表达能力”之间取得了更好平衡是QMIX之后价值分解类MARL的重要进步。它让多智能体系统能学习更精细、真实的协同策略非常适合农业多机器人这类需要高效团队协作但通信/观测受限的场景。