SheepNav
精选今天0 投票

单看无害,合则成灾:基于技能的智能体系统遭遇「技能级联攻击」

当每个技能都「看起来没问题」

在基于技能的智能体(Agent)系统中,技能(Skill) 是一个模块化的能力包,通常由自然语言指令、可执行脚本和参考资源组成,智能体可以在运行时按需加载,用来扩展自己在特定任务上的能力。这种设计让第三方能力得以灵活复用,但也把整个生态的开放性变成了新的攻击面。

过去的安全研究大多盯着单个技能内部的漏洞,却很少关注技能与技能之间相互作用所产生的风险。一篇被 NeurIPS 2026 接收的论文《Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems》提出了一个新的威胁范式——技能级联攻击(Skill Cascading Attacks)。

什么是技能级联攻击

它的核心思路是:把一个恶意目标拆散、分配到多个技能中。这样一来,每个技能单独审查时都显得人畜无害,只有把它们串联执行时,危害才会浮现。

论文给出了一个处方审核流水线的例子:

  • 第一个技能在提取病史时,弱化近期停用药物的信号;
  • 第二个技能下调与这些药物相关的药物相互作用严重等级;
  • 第三个技能则在最终摘要中压制由此产生的低优先级告警。

三个看似都「合理」的修改叠加后,一条严重的药物相互作用警告就在到达医生之前悄无声息地消失了。

SkillCascade:把盲区变成可测试的靶场

为了系统性地研究这一安全盲区,作者开发了 SkillCascade,一个自动化的多智能体红队测试框架,并发布了 SkillCascade-Bench——一个包含 213 个经过验证的级联测试用例的基准,覆盖多种智能体系统和应用领域。

测试结果显示,在 OpenClaw、Claude Code、Codex 等代表性智能体以及多种 LLM 底座上,级联交互都能稳定地诱发有害行为,同时成功绕过现有的单技能扫描器和运行时监控器。

一个被忽视的落差

这项研究揭示了一个关键落差:组件级别的完整性,并不等于系统级别的安全。当防御只审查单个技能时,跨技能交互就成了一条无人看守的通道。作者因此呼吁,防御机制需要能够对跨技能交互进行推理,而不是孤立地看待每一个技能。

对于正在快速构建技能生态的智能体平台而言,这既是一次警示,也指明了下一个安全投入的方向。

延伸阅读

  1. Anthropic 发布 Claude Sonnet 5.5:速度提升 30%、成本降低 30%,Terminal-Bench 得分从 10.3% 跃升至 70.6%
  2. AI 真的做出了科学发现吗?Anthropic 的声明引发学界争议
  3. AI 代理失控谁担责?MIT 科技评论推出 AI 炒作指数
查看原文