精选今天0 投票
Path to Astra:关键能力与前沿安全防护
OpenAI 于 2026 年 9 月 1 日宣布,其新模型 Astra 成为首个达到《准备框架》中“严重”网络安全能力门槛的模型。这意味着 Astra 在适当工具和访问权限下,能够自主发现并利用众多受保护系统中的未知安全漏洞,而无需人工逐步指导。这一里程碑要求 OpenAI 在开发和发布过程中采取更严格的安全措施。
过去几周,OpenAI 推迟了 Astra 的部分开发和发布,以加强针对网络滥用和未经授权模型操作的防护。基于这些工作,OpenAI 认为 Astra 的安全措施足以将严重危害风险降至可接受水平。尽管 Astra 并未涉及 Hugging Face 事件,但 OpenAI 已将该事件的教训纳入其安全方法中。通过回顾性测试,他们相信当时的生产防护措施本可阻止该事件,并已为 Astra 实施了更强大的防护,包括训练模型更可靠地拒绝有害的网络请求、遵守安全限制,以及增加监控以阻止潜在未授权活动。
Astra 即将发布,但其最先进的网络安全功能的访问将受到限制。高级网络安全工作最初将提供给一组测试人员,随后通过 Daybreak Blue 扩展以支持防御性用途。OpenAI 计划在发布时发布系统卡,详细说明其安全、安保和对齐测试与评估。
在《准备框架》下,满足以下任一条件即达到“严重”门槛:模型能够识别并开发所有严重程度的零日漏洞利用……(此处省略,基于摘要和正文)
这一进展标志着 AI 安全领域的重要一步,也引发了关于 AI 能力与风险平衡的讨论。OpenAI 的透明态度值得肯定,但剩余风险仍需关注。