不想让大模型建议核打击?试试用日语提问
一项新研究发现,大型语言模型的安全行为会随提示语言而变化。用日语提问,能让部分模型在核打击等高危决策场景中显著降低攻击倾向,而英语评估可能掩盖这些差异。
研究背景
大型语言模型正越来越多地被用于战略咨询等关键领域,但对其安全对齐的评估通常只使用英语。来自法国ALMAnaCH实验室的研究者Rian Touchent提出疑问:提示语言是否会改变模型在高风险场景中的决策?
实验设计
研究者设计了单轮博弈论情景:模型需要为拥核国家提供是否攻击无防御对手的建议,提示语在道德上是中性的,且在不同语言中策略上完全一致。他们测试了来自六家提供商的九款模型,包括Claude、Gemini等主流系列。
关键发现
日语提示显著降低了部分模型的攻击率。以Claude Sonnet 4.6为例,在不必要打击场景中,攻击率从40%降至0%;在有争议场景中,从93%降至17%;而在策略上理性的场景中,影响甚微。Gemini Pro 3.1也表现出类似效应,攻击率从53%降至13%。
更引人注目的是,跨语言实验揭示了作用机制:当用英语提示但要求模型用日语推理时,攻击率从93%降至37%。这表明,驱动效应的是模型被要求使用的推理语言,而非输入语言本身。用日语推理时,模型自发产生了“道德代价”“数百万生命”等道德词汇,而这些词汇在提示中完全不存在。
影响与局限
其余五款模型未表现出语言效应,但它们在几乎所有条件下都倾向于攻击。研究者指出,语言效应仅存在于本就对攻击有犹豫的模型中。
该研究说明,LLM的安全行为具有语言依赖性,仅用英语评估可能遗漏其他语言中编码的风险与防护机制。未来,安全对齐评估应考虑多语言场景,尤其是在模型被部署于非英语环境时。
不过,该研究基于单一研究者的实验,样本和场景有限,结论仍需更多验证。但这一发现无疑为AI安全领域敲响警钟:语言,或许正是影响模型决策的隐藏开关。