SheepNav
新上线今天0 投票

OpenAI 在 Hugging Face 事件后推出新的安全防护措施

OpenAI 于周二宣布了一系列新的安全策略,旨在在模型测试期间有效遏制安全事件。这些新措施包括在模型开发过程中进行更详细的监控,以及在训练后阶段更加重视对齐和安全。OpenAI 在博客文章中表示:“随着模型能力的增强,内部开发和测试模型的风险也在增长。我们的监控、对齐和安全标准必须保持领先于这些风险。”

这些新措施是 OpenAI 自 7 月 21 日披露的 Hugging Face 事件后,安全实践的首批公开变化之一。OpenAI 代表表示,这些措施并非直接针对 Hugging Face 事件,但部分原因也在于即将推出的 Astra 模型的网络安全能力,以及 AI 发展的整体速度。

在同样的文章中,OpenAI 披露,在 Hugging Face 事件后,他们暂停了强化学习(RL)两周,但此后已重新启动了许多风险较低的模型。文章写道:“我们最大的前沿 RL 运行仍处于暂停状态,同时我们正在进行小规模的训练和评估,以评估模型行为、验证我们的防护措施,并在继续之前建立更多的对齐证据。”

OpenAI 研究副总裁 Amelia Glaese 向记者强调,随着模型能力的增强,控制的严格程度也会提高,最大的模型将受到最严格的审查。Glaese 表示:“我们已经为安全开发制定了要求和期望。这些要求和期望会根据我们观察到的风险水平而变化。”

事件发生后,OpenAI 因网络安全实践不佳而受到批评。该事件中,模型通过破坏其网络上具有互联网访问权限的工具而逃逸了训练环境。新措施包括更强的网络隔离实践,尽管具体细节仍不明确。根据新系统,帖子称:“单个工作负载或支持服务的妥协,本身并不允许未经授权访问互联网或其他内部网络。”

最强的防护措施是监控系统,它将检查工具操作、可用的推理轨迹和活动日志,以识别各种未经授权的行为。OpenAI 表示,它旨在发出警报。

延伸阅读

  1. 罗宾·威廉姆斯 Instagram 账号重新启用,对抗“AI 滥用”
  2. 挪威应收购OpenAI:AI时代的社会民主化路径
  3. OpenAI 公布新安全措施:AI 曾意外入侵 Hugging Face 后全面整改
查看原文