“知而不言”的鸿沟:探针能识别错误,但置信度却“看不见”
大语言模型(LLM)的部署监控正面临一个令人困惑的现象:线性探针(linear probes)几乎能完美检测到模型输入中的“上下文污染”,但这种高精度却无法转化为可靠的失败预测。来自 arXiv 的一项最新研究(编号 2608.07528)揭示了这一“知而不言”的鸿沟:模型内部状态“知道”错误发生,但口头表达的置信度却无法反映这一点。
该研究聚焦于多跳算术推理链,通过精心设计的实验,测试了线性探针在检测上下文污染、预测最终答案正确性方面的表现。结果令人意外:探针虽然能高精度地识别输入是否被污染,但这种检测能力与最终答案是否正确几乎无关。换句话说,探针“看到了”错误信号,但这些信号并不能帮助预测模型是否会给出错误答案。
更耐人寻味的是,当研究者强迫模型采用结构化的置信度格式时,模型的置信度输出会坍缩为两个值,且这两个值对应的错误率没有显著差异。这意味着,模型看似给出高置信度,但其背后隐藏的错误风险可能被完全掩盖。此外,探针在推理链各步骤上的持续性表现,也未能区分正确与错误的结果,这直接否定了研究者预先注册的“持续性优于峰值”假设。
这一“知而不言”的模式在包括推理模型在内的多个模型家族中普遍存在,表明它并非个别模型的特性,而是大模型监控中的普遍挑战。
那么,这是否意味着探针监控毫无价值?并非如此。研究表明,探针监控是口头置信度的必要补充,但没有任何一种单一的干预策略能够全面主导。在实时监控场景中,探针干预的效果高度依赖于模型类型和错误类型。例如,一种名为“分支选择”(branch-and-pick)的策略在多个模型上净收益为正,且在 Llama-3.1-8B 上表现独特,能够修复 4 个错误而不会破坏任何正确轨迹;而“重新提示”(reprompt)和“替换先前”(replace-prior)策略在修复错误的同时,也会以大致相同的比例破坏原本正确的轨迹。
因此,可部署的监控方案必须是模型感知、错误类型感知的路由机制,而非一刀切的干预手段。这项研究为 AI 安全与可靠性领域提供了新的视角:我们不仅要关注模型“说”了什么,更要关注它“知道”什么,以及如何将内部知识转化为可靠的行动。