响应重整化:为临界深度均衡模型稳定训练梯度
深度均衡模型(Deep Equilibrium Models, DEQs)通过隐式微分训练,其梯度计算依赖于求解残差雅可比矩阵的伴随系统。当该矩阵在损失敏感方向上接近奇异时,微小扰动会被强烈放大,导致梯度爆炸,使优化过程不稳定。近期,研究者提出一种名为响应重整化(Response Renormalization)的框架,旨在无需全局抑制条件良好的灵敏度即可控制临界伴随放大,从而提升训练的可靠性。
背景与挑战
DEQs 的核心在于寻找一个固定点,使得隐藏表示在模型更新后保持不变。训练时,通过隐式微分计算梯度,需要求解一个基于残差雅可比矩阵的伴随系统。如果该雅可比矩阵在损失敏感方向上接近奇异(即临界状态),伴随响应会对扰动异常敏感,产生巨大且高度不稳定的梯度,导致优化过程不可靠。
响应重整化框架
论文引入响应重整化,这是一种后向传播框架,它选择性地提升(lift)接近极点的分母,同时保持未提升的响应通道不变。具体包括两种变体:
- 集体模式响应重整化(CMR):在低维临界子空间中应用校正,只修正关键方向的响应。
- Phi-自适应 CMR(Phi-CMR):基于正磁化率规则计算有界的响应质量,进一步自适应调整校正程度。
研究者推导了密集和矩阵自由的集体公式,区分了修改后的冻结锚残差的精确梯度与后向响应替代项,并将该构造扩展到结构化隐式层和矢量吸引子(SILVA)。
实验验证
在涵盖偏微分方程、三维场、算子映射、复杂几何和粒子系统的 23 个多物理场族中,CMR 和 Phi-CMR 在超过 98% 的静态 和 95% 的瞬态 族-种子比较中,测试误差比使用精确隐式微分训练的模型高出不超过 5%。求解器索引实验显示其收敛于静态伴随,而物理时间滚动在评估条件下保持了预测保真度。
意义与展望
选择性响应重整化能够在不大幅损失有效梯度信息的前提下,控制临界伴随放大,使参数更新更加可靠。这一方法为训练深度均衡模型提供了一种实用且稳健的替代方案,尤其适用于涉及复杂物理系统的任务。尽管实验效果显著,但该方法在更广泛模型(如大规模语言模型)上的适用性仍有待探索。

