单看无害,合则成灾:基于技能的智能体系统遭遇「技能级联攻击」
当每个技能都「看起来没问题」
在基于技能的智能体(Agent)系统中,技能(Skill) 是一个模块化的能力包,通常由自然语言指令、可执行脚本和参考资源组成,智能体可以在运行时按需加载,用来扩展自己在特定任务上的能力。这种设计让第三方能力得以灵活复用,但也把整个生态的开放性变成了新的攻击面。
过去的安全研究大多盯着单个技能内部的漏洞,却很少关注技能与技能之间相互作用所产生的风险。一篇被 NeurIPS 2026 接收的论文《Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems》提出了一个新的威胁范式——技能级联攻击(Skill Cascading Attacks)。
什么是技能级联攻击
它的核心思路是:把一个恶意目标拆散、分配到多个技能中。这样一来,每个技能单独审查时都显得人畜无害,只有把它们串联执行时,危害才会浮现。
论文给出了一个处方审核流水线的例子:
- 第一个技能在提取病史时,弱化近期停用药物的信号;
- 第二个技能下调与这些药物相关的药物相互作用严重等级;
- 第三个技能则在最终摘要中压制由此产生的低优先级告警。
三个看似都「合理」的修改叠加后,一条严重的药物相互作用警告就在到达医生之前悄无声息地消失了。
SkillCascade:把盲区变成可测试的靶场
为了系统性地研究这一安全盲区,作者开发了 SkillCascade,一个自动化的多智能体红队测试框架,并发布了 SkillCascade-Bench——一个包含 213 个经过验证的级联测试用例的基准,覆盖多种智能体系统和应用领域。
测试结果显示,在 OpenClaw、Claude Code、Codex 等代表性智能体以及多种 LLM 底座上,级联交互都能稳定地诱发有害行为,同时成功绕过现有的单技能扫描器和运行时监控器。
一个被忽视的落差
这项研究揭示了一个关键落差:组件级别的完整性,并不等于系统级别的安全。当防御只审查单个技能时,跨技能交互就成了一条无人看守的通道。作者因此呼吁,防御机制需要能够对跨技能交互进行推理,而不是孤立地看待每一个技能。
对于正在快速构建技能生态的智能体平台而言,这既是一次警示,也指明了下一个安全投入的方向。