精选今天0 投票
OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御框架
研究背景与挑战
基于大语言模型的多智能体系统(LLM-MAS)正被部署于安全关键型应用中,但智能体间的通信链路也为攻击者提供了可乘之机。攻击者通过注入恶意指令,使恶意行为在智能体网络中扩散。与传统静态威胁不同,LLM-MAS 面临的是双重动态攻击:一方面,攻击者会根据部署的防御策略不断调整注入手法;另一方面,正常智能体的行为模式也会随着系统扩展而发生漂移。
现有防御方法大多将部署视为封闭世界问题,一旦数据分布偏离训练覆盖范围,防御性能便会迅速下降。这促使研究者探索能同时应对攻击策略演变与正常行为漂移的持续防御方案。
OpenEvoShield 框架核心
针对上述挑战,研究团队提出了 OpenEvoShield,一个面向 LLM-MAS 的协同进化持续防御框架。其核心组件包括:
- 非对称速率控制器(M1):从双重漂移信号中解耦出攻击侧快速学习速率和正常侧慢速学习速率,实现差异化的更新节奏。
- 正常边界更新器(M2):以慢速速率维护一个动态的行为边界,用于区分正常与异常交互。
- EWC 正则化策略集成(M3):采用弹性权重巩固(EWC)技术,使策略集成能够快速适应新攻击而不发生灾难性遗忘。
- 基于能量的多粒度检测器(M4):融合节点级、子图级和图级证据,将新型攻击分类为分布外样本。
实验验证与性能
研究者在5个基准测试和4种多智能体拓扑结构上进行了100轮部署实验。结果显示,OpenEvoShield 显著优于静态和持续基线方法,能够检测出绝大多数未见过的攻击类型,同时保持较低的误报率。
行业意义
该工作首次将非平稳环境下的持续学习引入 LLM-MAS 安全领域,为应对真实世界中攻击策略与系统行为双重演变提供了理论框架和实用方案。随着多智能体系统在金融、自动驾驶、医疗等领域的深入应用,类似 OpenEvoShield 的持续防御机制将成为保障系统安全的关键技术。