在网络关键能力时代,如何为模型开发设定节奏
过去几周,两个事件凸显了日益强大的 AI 系统带来的风险:OpenAI-Hugging Face 事件,以及初步证据表明我们即将推出的模型 Astra 可能达到我们准备框架下的“关键网络安全能力”阈值。这些事件,加上内部研究的快速进展,使得我们加强监控、对齐和遏制保障的工作变得更加紧迫。
随着模型能力的增强,内部开发与测试的风险也随之上升。我们的监控、对齐和安全标准必须领先于这些风险。为了确保达到标准,我们暂时放缓了扩展速度,包括暂停了面向部署的最新模型的强化学习训练两周,同时进一步加固和红队测试研究环境,并扩大监控系统的覆盖范围。我们最大的前沿 RL 运行仍处于暂停状态,先进行小规模训练和评估,以观察模型行为,验证保障措施,并建立对齐证据。
对齐——让 AI 系统按预期行为并接受人类监督——一直是我们研究的核心。我们现在要求在整个训练过程中有更强的对齐证据,基于已有的研究和评估。保持日益强大的系统对齐是整个领域需要解决的挑战。
我们认为,透明地说明我们方法的改变非常重要。以下是我们已经对研究流程和基础设施所做的改变,以及正在进行的工作。我们开发更强大模型的方法依赖于三个相互加强的保障:监控(检测并响应异常行为)、对齐(减少有害或未经授权行为的可能性)以及安全措施(保护模型和基础设施)。
在监控方面,我们扩展了监控系统,以更早地检测到危险能力或越狱行为。在对齐方面,我们实施了新的对齐验证步骤,包括更严格的评估和红队测试。在安全方面,我们加强了研究环境的安全,限制了内部访问,并改进了遏制协议。
这些变化意味着我们正在调整模型开发的节奏。我们相信,在推进能力的同时,确保安全是负责任的做法。我们的目标是在安全与进步之间取得平衡。
我们认识到,这些措施可能会影响部署时间表,但安全必须是首要任务。我们致力于与更广泛的社区分享经验,共同应对这些挑战。未来,我们将继续评估和调整我们的方法,以确保我们的模型安全可靠。