OpenAI 披露并瓦解一起协同模型蒸馏攻击行动
一次被及时拦截的"推理窃取"
OpenAI 近日公开披露,其识别并瓦解了一起协同模型蒸馏攻击行动,最早的可疑活动可追溯至 7 月第一周,而大规模攻击高峰出现在 7 月 24 日和 25 日——两天内涉及 超过 4000 名用户、约 16000 次请求,且都使用了相关的提取模式。
值得注意的是,攻击者并未攻破加密、入侵数据库,也没有直接获取存储的用户对话。他们采用的是另一种方式:通过操控模型交互,让本应受保护的推理内容以请求者可见的形式被复现。
什么是"对抗性蒸馏"
OpenAI 将这起事件定性为对抗性蒸馏(adversarial distillation),即系统性地、未经授权地利用某个模型的输出或推理过程,去帮助训练、复现或改进另一个模型。
这里的关键概念是受保护推理(protected reasoning)——它是模型处理任务时的内部记录。与最终答案不同,推理过程可能包含被刻意保留、未在答案中呈现的信息。一旦这些内容被提取,外部方就有可能借此复现模型的核心能力。
攻击手法:跨对话"解密转录"
根据 OpenAI 的描述,攻击者尝试了多种新颖的提取方式,其中一种典型手法是:
- 从一个对话中复制加密的推理内容;
- 在另一个对话中要求模型解密并转录这些隐藏的推理内容。
此外,独立安全研究人员也通过负责任披露渠道,向 OpenAI 报告了相关的跨模型漏洞和对话压缩漏洞。OpenAI 调查后确认这些攻击路径真实存在,并表示研究人员的发现帮助他们理解了更广泛的攻击类别,加速了缓解措施的落地。
不是 OpenAI 独有的问题
OpenAI 明确表示,这种操控手法并非其模型独有的漏洞。公司已通过 Frontier Model Forum 与行业伙伴共享相关信息,以强化整个生态对对抗性蒸馏的集体防御能力。
在对外发布前,OpenAI 完成了以下工作:
- 调查攻击的范围和潜在影响;
- 部署自身的缓解措施;
- 与研究人员和行业伙伴共享信息并收集反馈,确保针对此类攻击的防护到位。
OpenAI 同时强调,额外的缓解和调查工作仍在继续。公司认为,现在分享已掌握的信息,有助于更广泛的生态系统加强防御。
为什么这件事值得关注
随着大模型能力竞争加剧,模型推理过程本身正成为高价值资产。对抗性蒸馏的兴起,意味着攻击面已从传统的"数据泄露"扩展到"能力窃取"——即便没有数据被直接盗走,模型的核心能力也可能被间接复制。
对行业而言,这起事件释放了一个清晰信号:模型安全不再只是防止越狱或数据泄露,还包括保护推理过程不被系统性提取。OpenAI 选择公开披露并与行业共享,也反映出前沿模型厂商在对抗性蒸馏问题上正走向协同防御。
