精选今天0 投票
大语言模型中的稳定误校准:高置信度错误的实用视角
大语言模型(LLM)在高置信度下给出错误答案,通常被视为模型内部推理脆弱的信号。然而,一篇新论文提出了另一种可能性:稳定误校准——模型自信地犯错,且这种错误在微小扰动下保持稳定。该研究发表于 arXiv(编号 2608.13591),已被 ICML 2026 的 EIML 研讨会接收。
研究者设计了一套双管齐下的诊断方法:一是标签感知的输出级审计分数,用于按领域排序置信度变化和强迫回答基线下的过度自信错误;二是内部敏感性探针,测量隐藏层的移动。在多领域二元事实审计集上,审计分数能够追踪到“基于放弃的自我批判”减少决策损失的位置,尽管直接标注基线对相同增益的排序更强。
在内部层面,自我批判提示在三个开放权重模型中一致地降低了各层的隐藏状态敏感性。这支持了提示诱导的局部稳定化,而非纯粹的输出级放弃模式。但研究也明确指出,这并不等同于校准:审计定义的过度自信错误并不比自信正确的答案更局部敏感,因此某些高置信度错误可能是稳定的误校准,而非简单脆弱。
这一发现对 AI 安全与可靠性有重要启示。若高置信度错误并非源于推理脆弱,而是稳定存在,那么依赖置信度分数进行风险控制的方法可能失效。该研究提示,需要更精细的校准策略,而非仅依赖内部不确定性信号。
尽管该研究基于特定架构与数据集,其结论为理解 LLM 错误本质提供了新视角,也为未来的校准研究指明了方向。