何时沟通?基于信念分布与KL散度的多智能体强化学习门控机制
在多智能体强化学习(MARL)中,智能体之间的通信是协作的关键,但一个长期被忽视的问题是:智能体应该何时通信?现有方法要么在每个时间步都进行通信,要么通过REINFORCE策略梯度学习一个二值门控信号,后者往往因高方差而训练不稳定,且门控行为难以解释。
最近,一篇来自arXiv的论文提出了一种更 principled 的替代方案:基于KL散度的信念门控机制。每个智能体维护一个关于潜在世界状态的信念分布,该分布通过对LSTM隐藏状态进行softmax计算得到。智能体仅在信念分布之间的KL散度超过固定阈值时进行通信,从而避免无谓的信息交换,提高通信效率。
研究者在IC3Net的Predator-Prey基准和MPE simple_spread环境上进行了实验。在10x10的Predator-Prey任务中,IC3Net在所有阈值下都优于KL门控方法;但在更困难的20x20任务中,阈值消融实验呈现出倒U型关系:当阈值ε=0.5时,KL门控方法达到73.84步平均完成时间和42%成功率,而IC3Net为75.31步和31%,提升了1.47步和11个百分点,且种子方差更小。
更令人意外的是,在MPE环境中,即使门控机制未激活,引入信念头也带来了平均奖励提升12点、方差降低26倍的效果。这表明该方法的贡献有两个正交来源:一是当信念能够收敛时,门控机制提供了更合理的通信时机;二是信念头本身改善了潜在表示,从而促进了智能体间的协调。
这项研究为多智能体通信的“时机”问题提供了新的视角,提示我们通信决策应基于信息论原则,而非简单的随机策略。其潜在应用包括无人机编队、自动驾驶车队协同等需要高效通信的场景。不过,论文也指出,在简单任务中该方法并未超越现有基线,说明其优势主要体现在复杂环境中,未来工作可进一步探索如何动态调整阈值或结合其他门控机制。