精选今天0 投票
大语言模型竟有稳定的“风险态度”:就像人类一样,有的激进有的保守
最新研究揭示,大语言模型(LLM)在面对不确定性时,会表现出系统性的、一致的风险态度——就像人类一样,有的模型天生“激进”,有的则偏向“保守”。
来自佛罗里达大学等机构的研究团队在预印本平台 arXiv 上发布了一篇论文,首次系统地检验了 LLM 在不确定性下的风险行为。他们设计了一个跨领域框架,将“上下文风险信念”与“分类决策”解耦,并测试了六款代表性 LLM(如 GPT-4、Claude 等)以及 100 名人类参与者在空间导航、临床分诊和金融分配三类任务中的表现。
关键发现:风险态度是 LLM 的稳定特质
通过回归模型提取每个智能体的“信念-决策映射”,研究量化了风险敏感度和风险态度偏差。核心结论有三:
- 任务内一致性:在同一个任务领域内,LLM 从上下文信念到风险决策的映射关系非常稳定,不会因提示措辞的细微变化而摇摆。
- 跨领域排序稳定性:如果一个模型在金融任务中偏向激进,它在空间导航和临床分诊任务中也会表现出相对激进的风险偏好——风险态度的“排序”在不同领域间保持一致。
- 向狭窄风险态度分布收敛:与人类参与者相比,LLM 的风险态度分布范围更窄。换句话说,AI 的风险偏好更“保守”或更“集中”,不像人类那样极端多样。
为什么这很重要?
长期以来,AI 对齐研究主要关注模型的能力(如推理、知识)和安全性(如避免有害输出),但风险态度这一维度一直被忽视。这项研究首次将风险态度确立为 LLM 行为的一个稳定、可测量的特质,为评估和校准 AI 在开放式决策中的表现奠定了基础。
潜在影响:从自动驾驶到医疗决策
想象一下,如果自动驾驶 AI 在面临“急转弯避让”时过于激进,或者医疗 AI 在分诊时过度保守,后果可能截然不同。理解并控制模型的风险态度,对于部署在金融交易、医疗诊断、军事指挥等高赌注场景中的 AI 系统至关重要。
未来方向
论文指出,仍需进一步探索这些内在行为倾向的起源——是来自训练数据中的风险偏好模式,还是模型架构本身导致的?此外,如何通过微调或提示工程来调整模型的风险态度,也是一个开放问题。
总之,这项研究提醒我们:AI 不仅会“思考”,还会“感受”风险。对齐工作的下一个前沿,或许就是校准它们的“性格”。