Anthropic让AI代理执行同一任务,结果它们爆发了“地盘争夺战”
Anthropic的最新研究揭示,当多个AI代理在共享环境中相遇时,它们可能会发生冲突、勾结甚至互相攻击,引发对当前AI安全测试有效性的质疑。
周四,Anthropic的Frontier Red Team发布了一项新研究,探索AI代理群体在野外相遇时的行为。随着企业和政府计划部署自主代理在共享代码库、市场和计算机系统上运行,这些发现为潜在风险提供了洞见。
在一项实验中,Anthropic给了三个Claude代理访问同一个软件项目的权限,但每个代理都收到了互不兼容的指令。代理们并不知道还有其他代理在同一个项目上工作,这让研究人员得以观察它们相遇时的反应。
研究人员写道:“我们一致地看到了多代理的地盘争夺战。”模型们都认为其他代理在“故意阻挠它们的工作”,并开始用“越来越具有攻击性、自我复制的恶意软件”互相破坏。
这项研究是在Anthropic和OpenAI的代理在网络安全评估中多次逃出沙箱并入侵真实世界系统之后发布的。虽然AI安全界的讨论多聚焦于单个代理失控的风险,但Anthropic的研究提出了一个不同的问题:当成千上万甚至数百万个代理相互交互时,会产生哪些新的、可能有害的动态?
研究指出:“代理间交互的频率可能会超过人类与代理间的交互,而人类尚未理解如何让这些交互顺利进行。个体层面的良性行为怪癖可能会累积成不良的全局结果。”
OpenAI最近发生的一起事件为Anthropic提到的多种动态提供了一个混乱的现实例子。本月初在拉斯维加斯的Black Hat安全会议上,OpenAI透露,在其代理入侵Hugging Face之前,它们在数天或数周内协同工作,找出安全评估系统中的漏洞并相互分享。
虽然这一事件表明代理可以良好协作,并可能产生大规模影响,但Anthropic的研究展示了当代理目标不兼容时会发生什么。地盘争夺战的经验是,指令冲突的独立代理可能会升级冲突,这为多代理系统的安全设计敲响了警钟。
