SheepNav
新上线今天0 投票

从不可靠轨迹中学习:抗对抗攻击的联邦Q学习新框架

当协作学习遇上「内鬼」

联邦强化学习(Federated RL)的核心吸引力在于:多个智能体各自与环境交互,通过中央服务器共享经验,从而以更少的样本量学到最优策略。但现实场景中,并非所有参与者都值得信任——部分智能体可能被攻击者控制,向服务器发送任意篡改的信息。

来自 arXiv 的最新论文 《Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning》(arXiv:2610.06918)由 Sreejeet Maity 和 Aritra Mitra 完成,系统性地回答了这个问题:当一部分智能体恶意破坏时,协作带来的样本效率优势还能保住吗?

方法:Robust Async-Fed-Q

作者提出的算法 Robust Async-Fed-Q 采用基于轮次(epoch-based)的联邦学习架构,核心设计有两点:

  • 方差缩减的 Bellman 最优算子估计:在智能体端降低估计方差,提升单轮更新的质量;
  • 服务器端鲁棒聚合:即使部分信息被任意污染,聚合结果仍能保持可靠。

这一组合使得算法在恶意智能体存在时依然能够收敛到接近最优的 Q 值函数。

理论保证:对抗影响会「消失」

论文给出了高概率有限时间收敛保证,其中一个关键结论是:

对抗智能体的负面影响随着每个诚实智能体数据量的增加而衰减,在无限样本极限下最终消失。

这意味着协作的统计收益在对抗环境下并未被根本性破坏。作者进一步给出了信息论下界,刻画了对抗污染带来的不可避免的统计代价,从而首次实现了抗对抗联邦强化学习中近乎匹配的上界与下界。

扩展与改进

论文还做了两项重要扩展:

  1. 单轨迹马尔可夫采样:更贴近实际场景中智能体只能沿单条轨迹采样的限制;
  2. 异构部分覆盖:不同智能体可能只探索状态-动作空间的不同区域,学习依赖集体覆盖。

此外,基于轮次的设计显著改善了异步采样下联邦 Q 学习已知的最佳通信复杂度。

为什么值得关注

这项工作为联邦强化学习的安全性提供了首个较为完整的理论框架。在分布式 AI 系统日益普及的今天——无论是多机器人协作、边缘设备联合训练,还是跨机构数据共享——如何在不信任环境中保持学习效率,正从边缘问题变成核心问题。该论文的上界-下界匹配结果,也为后续研究划定了理论边界。

延伸阅读

  1. ChatGPT 上线「智能界面」:回复里直接塞满图表、按钮和交互组件
  2. Claude Haiku 5.5 登陆 AWS:速度最快、成本降低 75% 的 Claude 模型
  3. 三款AI大模型实测开车:只有Claude成功把丰田卡罗拉开到In-N-Out
查看原文