
新技巧揭示AI模型的内心思考
计算机科学家最近发现了一种方法,可以从前沿AI模型处理复杂问题时的隐藏“思考”过程中提取信息。这些发现为某些中国模型可能通过“蒸馏”美国模型(如Claude、GPT和Gemini)的推理信息而训练提供了一些证据,尽管并非确凿。研究人员还证明,该方法可用于从模型内部推理中恢复个人信息,如密码和API密钥,但此漏洞已被修复。
德国图宾根大学的计算机科学家Alexander Panfilov表示:“我们测试的所有主要前沿模型提供商都存在此漏洞。”他参与的研究团队来自图宾根大学、马克斯·普朗克研究所、AI安全研究所MATS Research和网络安全公司Snyk。他们发现,通过API访问的OpenAI、Anthropic和Google的前沿模型均受影响。
在相关论文中,研究人员展示了Moonshot AI的开源模型Kimi K3在特定提示下产生的输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理轨迹惊人相似。然而,他们强调这“不能因果性地确立蒸馏”。他们发现,中国的DeepSeek和美国的Thinking Machines公司的Inkling模型并未表现出与Claude Opus的这种相似性。Moonshot AI和Z.ai未回应置评请求。
蒸馏是一种成熟且广泛使用的技术,用于高效复制现有模型的能力,尤其在开发开源或完全可下载模型时。然而,最近蒸馏成为争议话题,因为有指控称中国AI公司利用它来复制美国顶级模型。今年2月,OpenAI向美国立法者表示,DeepSeek似乎复制了其一个模型来构建推理模型R1。
这项研究的发现不仅引发了对模型蒸馏的担忧,还揭示了API接口的安全漏洞。虽然该漏洞已被修复,但研究人员提醒,这可能导致个人信息泄露,并使得大规模蒸馏攻击成为可能。随着AI模型的复杂性增加,保护其内部推理过程变得越来越重要。

