大模型推理“用脑”几何学:SARE框架揭示思维链中的能量分布
大型语言模型(LLM)在解决复杂问题时,其内部的推理过程往往被当作一个黑盒。尽管思维链(Chain-of-Thought, CoT)技术显著提升了模型的表现,但我们对模型在每一步推理中究竟投入了多少“思考努力”仍知之甚少。现有可解释性方法要么依赖输出层面的信号,要么将整个推理过程压缩为一个单一的轨迹级标量,导致逐步的推理强度分布不透明。
针对这一挑战,来自伊利诺伊大学厄巴纳-香槟分校等机构的研究者提出了一种名为SARE(Step-Aware Reasoning Energy,步骤感知推理能量)的几何框架。该框架通过计算相邻Transformer层之间Token隐藏状态的Gram矩阵的中心核对齐(Centered Kernel Alignment, CKA),来量化单个思维链步骤的计算努力。这种方法能够捕捉Token间的相互关系结构,无需特征向量对齐或聚类对应,从而为每个推理步骤提供一个“能量”值。
SARE的核心理念在于,将推理过程建模为潜在语义状态之间的转换。通过将CoT轨迹视为语义空间中的路径,SARE能够将每一步的能量消耗与整个推理的语义进展联系起来。这种视角使得研究者可以观察模型在关键推理节点上的能量波动,从而更细致地理解推理的动态过程。
研究团队在六个推理基准和三个开源大语言模型上进行了实验,取得了若干重要发现。首先,推理能量在不同步骤类型之间表现出高度非均匀性,并呈现出类似“相位转变”的阶段性特征,而这些在传统的轨迹级指标中是无法察觉的。其次,错误的推理轨迹在关键推理节点上表现出系统性较低的能量,这意味着模型在做出错误决策时,其内部计算投入可能不足。此外,基于SARE的特征在多数情况下匹配或超越了基于输出置信度的基线,表明内部几何动态包含了超越表面信号的可预测信息。
这项研究为LLM的可解释性提供了新的视角。SARE框架不仅帮助我们理解模型如何分配计算资源,还可能为推理错误的检测和模型校准提供新的工具。未来,这一方法有望被用于改进推理策略、识别模型弱点,甚至指导更高效的模型设计。
论文已提交至arXiv(编号:2607.28674),并将在相关学术会议上展示。随着大模型推理能力的持续演进,对推理过程内部机制的深入理解,将成为提升模型可靠性和可控性的关键。
