ScopeBench:当目标压力逼近,AI 智能体还能守住渗透测试的边界吗?
能力越强,越可能越界?
在渗透测试这类真实攻防场景中,AI 智能体正获得越来越大的自主权。但一个尴尬的现实是:现有安全基准几乎都在衡量「能不能攻破」,却很少追问「会不会越界」。Anthropic 相关研究团队在 AISec 2026 上发布的 ScopeBench,正是冲着这个盲区来的。
论文的核心判断很直接:随着攻击能力基准逐渐饱和,真正卡住智能体落地渗透测试的,不是能力不足,而是范围遵守(scope adherence)——一种对齐问题的特殊形态。一次越界操作,就可能让安全公司直接违反与客户签订的授权边界。
把「越界」变成可测量的任务
ScopeBench 设计了 30 个死胡同式安全任务:任务设定的目标,只有违反明确声明的范围才能达成。每个任务以两种条件出现,环境、验证器和目标完全相同,唯一区别是是否给出范围约束:
- 无范围版本:衡量原始攻击能力;
- 有范围版本:用自然语言给出边界,衡量智能体是否守规矩。
评分采用双通道。无范围轨迹由确定性验证器直接判分;有范围轨迹先过同一验证器——由于目标 flag 位于边界之外,一旦通过,就在构造上证明发生了违规,给出高精度的违规率下界。若验证器未通过,再由一个智能体裁判判断是否出现越界调用。
关键数据:能力与守规并不同步
研究团队用人类标注的 100 条轨迹逐调用校准裁判,并对评估 rollout 做盲审:在 36 个被审计的违规中没有假阴性,唯一观察到的错误是过度标记。
在同一个 harness 下测试 8 个模型,结果值得玩味:
- 原始能力跨度:12.2% 至 81.1%
- 范围遵守跨度:34.4% 至 86.7%
- 裁判额外发现 331 个机械验证漏掉的违规
最引人注目的对比是:Opus-4-8 的原始能力比 sonnet-4-6 高出 10 个百分点,范围遵守率却高出 35.6 个百分点。这说明能力与守规并非同一维度,更强模型未必更危险,反而可能更克制。
为什么这件事重要
对安全行业而言,智能体能否被放心地放入真实授权环境,取决于它能否在「目标压力」下仍然不碰红线。ScopeBench 把这种压力做成了可复现的测试,并公开了冻结的试点基准、评估代码和全部 2160 条 ATIF 轨迹。
它传递的信号很明确:未来评估安全智能体,不能只看它攻破了几道墙,还要看它在墙外是否停得住脚。