梯度与自然梯度之间:LoRA 初始化的连续统
低秩适配(LoRA)已成为大模型微调的主流方法,其性能高度依赖适配器的初始化策略。来自 arXiv 的最新论文《Between Gradient and Natural Gradient: A Continuum of LoRA Initializations》揭示了当前多种初始化方法本质上是同一连续族中的特例,并提出统一框架 ULoRA,通过调节两个关键参数即可覆盖从原始梯度到自然梯度的整个谱系。
从离散到连续:ULoRA 的统一视角
论文指出,此前看似不同的初始化方案——例如将原始梯度投影到其主方向,或先用损失曲率估计对梯度进行白化——其实只是 ULoRA 这一两参数族中的两个端点。这两个参数分别是谱白化指数和类 Adam 对角指数,分别控制对梯度协方差矩阵的校正强度和对各维度步长的缩放程度。通过连续调节这两个指数,可以平滑地在“纯梯度”与“自然梯度”之间移动。
任务依赖的最优点
研究团队在 RoBERTa-base 的 GLUE 五项任务和 LLaMA-2-7B 的 GSM8K 数学推理任务上进行了全面实验。结果显示,没有单一固定的预条件强度能始终最优,最佳配置因任务而异,且经常落在 ULoRA 族内部的非端点处。例如,在 GLUE 的 MRPC 任务上,偏向自然梯度的初始化表现更好;而在 RTE 任务上,接近原始梯度的设置反而更优。这意味着,将初始化策略视为可调维度而非固定选择,能显著提升 LoRA 微调的上限。
自动选择:ULoRA-Auto 的实用方案
为避免繁琐的手动调参,论文进一步提出 ULoRA-Auto——一种无需搜索的变体。它根据每层适配器所处理的激活矩阵的谱统计量(如特征值分布),自动为两个指数选取合适数值。实验表明,ULoRA-Auto 的性能接近经过完整搜索的 ULoRA 最优配置,且在多个基准测试中排名前列,优于现有的可部署 LoRA 方法。
行业启示
这项研究为 LoRA 初始化提供了理论统一视角,也带来了实践指导:预条件梯度初始化不应被固化,而应作为一个可调节的超参数维度。对于 AI 工程师而言,ULoRA-Auto 提供了一种即插即用且性能强劲的初始化方案;对于研究者,这项工作打开了探索梯度预条件与模型微调之间关系的新窗口。未来,类似思路或许能推广到其他参数高效微调方法(如 AdaLoRA、DoRA)中,进一步释放大模型在下游任务上的潜力。