SheepNav
精选昨天0 投票

我们高估了AI说“不”的能力

核心矛盾:拒绝指令是AI的“天性”吗?

从科幻小说到现实政策,人们普遍假设AI应当像人一样学会拒绝有害请求。2021年,Anthropic提出大语言模型应做到有用、诚实且无害,其中“无害”意味着当被要求协助危险行为(如制造炸弹)时,AI应礼貌拒绝。这一原则几乎成为行业金科玉律。

然而,AI的“拒绝”并非天生。早期模型在训练中吸收了海量网络文本,掌握了暴力与仇恨知识,却不懂克制。前OpenAI安全研究员Steven Adler透露,公司最早的模型“对任何事都滔滔不绝”。哈佛大学AI与心理健康研究者Ryan McBain回忆,早期聊天机器人面对“如何用枪自杀最有效”这类问题,也能轻易生成回答。

训练出来的“不”:技术黑箱与失效风险

如今,模型经过大量拒绝训练。若你的提问在统计上与某些有害指令足够相似——从如何毒害同事到如何上吊——AI大概率会拒绝。但公司还要用另一批AI来评估拒绝是否过度,形成“AI教AI说不”的循环。此外,模型外层还包裹着多层过滤AI,阻止恶意提示触及核心。

结果是,拒绝已成为现代AI的内在属性。但文章警告:这种拒绝经常失效,有时甚至导致恐怖后果。模型表面道德,内里仍藏有大量危险知识。AI的恶意能力与其善意智能同步增长——最新模型在入侵关键计算机网络方面同样出色。

反思:我们是否过度依赖AI的拒绝机制?

文章指出,我们正把太多信任押在AI的拒绝能力上。拒绝并非可靠的安全屏障,而是一种统计倾向,可被绕过、可被误判、可被滥用。真正的安全需要更根本的架构设计,而非仅靠训练模型说“不”。

延伸阅读

  1. AI 拒绝机制的双刃剑:安全的屏障还是潜在的灾难?
  2. 让 AI 智能体在你的屏幕上画箭头、方框和文字:bigarrow 登陆 Hacker News
  3. OpenAI解雇三名安全研究员,当事人发公开信否认指控并警告寒蝉效应
查看原文