从不可靠轨迹中学习:抗对抗攻击的联邦Q学习新框架
当协作学习遇上「内鬼」
联邦强化学习(Federated RL)的核心吸引力在于:多个智能体各自与环境交互,通过中央服务器共享经验,从而以更少的样本量学到最优策略。但现实场景中,并非所有参与者都值得信任——部分智能体可能被攻击者控制,向服务器发送任意篡改的信息。
来自 arXiv 的最新论文 《Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning》(arXiv:2610.06918)由 Sreejeet Maity 和 Aritra Mitra 完成,系统性地回答了这个问题:当一部分智能体恶意破坏时,协作带来的样本效率优势还能保住吗?
方法:Robust Async-Fed-Q
作者提出的算法 Robust Async-Fed-Q 采用基于轮次(epoch-based)的联邦学习架构,核心设计有两点:
- 方差缩减的 Bellman 最优算子估计:在智能体端降低估计方差,提升单轮更新的质量;
- 服务器端鲁棒聚合:即使部分信息被任意污染,聚合结果仍能保持可靠。
这一组合使得算法在恶意智能体存在时依然能够收敛到接近最优的 Q 值函数。
理论保证:对抗影响会「消失」
论文给出了高概率有限时间收敛保证,其中一个关键结论是:
对抗智能体的负面影响随着每个诚实智能体数据量的增加而衰减,在无限样本极限下最终消失。
这意味着协作的统计收益在对抗环境下并未被根本性破坏。作者进一步给出了信息论下界,刻画了对抗污染带来的不可避免的统计代价,从而首次实现了抗对抗联邦强化学习中近乎匹配的上界与下界。
扩展与改进
论文还做了两项重要扩展:
- 单轨迹马尔可夫采样:更贴近实际场景中智能体只能沿单条轨迹采样的限制;
- 异构部分覆盖:不同智能体可能只探索状态-动作空间的不同区域,学习依赖集体覆盖。
此外,基于轮次的设计显著改善了异步采样下联邦 Q 学习已知的最佳通信复杂度。
为什么值得关注
这项工作为联邦强化学习的安全性提供了首个较为完整的理论框架。在分布式 AI 系统日益普及的今天——无论是多机器人协作、边缘设备联合训练,还是跨机构数据共享——如何在不信任环境中保持学习效率,正从边缘问题变成核心问题。该论文的上界-下界匹配结果,也为后续研究划定了理论边界。
