SheepNav
新上线今天0 投票

前向传播领域适配:无需跨层反向传播的大模型微调新方法

近期,一项来自 arXiv 的新研究提出了一种名为 前向传播仅 MLP 训练(Forward-Pass-Only MLP training, FPO) 的方法,旨在在不通过模型主体进行反向传播的情况下适配大型语言模型(LLM)。该方法宣称能实现 2.7 至 3.2 倍的标准微调吞吐量,同时峰值训练内存减少约 40%,并在领域外基准测试中保持与基线相当的种子噪声水平,这一特性是完整网络微调所无法可靠复现的。

核心观察:输出层误差近似真实梯度

FPO 方法建立在一个经验观察之上:在 Transformer 的后期层中,输出层的预测误差与真实梯度的余弦相似度在 0.47 至 0.59 之间(基于六个公开模型的调查)。这意味着,模型后期层的梯度可以通过输出层的误差信号来近似,而无需进行完整的反向传播。

为了利用这一特性,研究者引入了一个 两分钟的诊断工具,可以量化每一层的这种近似程度,从而确定哪些层适合进行后期层适配。基于该诊断,FPO 仅计算一次输出误差信号,并将其应用于每个目标层,不进行层间信号传播,也不构建任何自动微分图。

实验评估:性能与效率的平衡

研究者在三个模型家族上评估了 FPO:OLMo-2-7B、Qwen3-8B 和 Falcon3-7B。实验结果显示,FPO 在领域内困惑度上均有改善,同时在 MMLU、ARC-Challenge、HellaSwag 和 Winogrande 等基准测试中保持与基线相当的种子噪声水平。此外,将标准监督微调(SFT)定位到 FPO 的目标层也能达到类似效果,但墙钟时间成本是 FPO 的 2.2 倍

意义与展望

这项研究为大模型的高效适配提供了新的思路。传统的全网络微调计算成本高昂,而 FPO 通过避免反向传播,显著降低了计算和内存开销,同时保持模型性能。这对于资源受限的场景尤为重要,例如在边缘设备上部署或快速迭代模型。

然而,该方法的适用性可能局限于后期层,对于需要深层特征调整的任务,其效果仍需进一步验证。此外,诊断工具的实用性也依赖于模型架构的多样性。未来,研究者可以探索将 FPO 与其他参数高效微调技术(如 LoRA)相结合,以进一步提升效率。

总体而言,FPO 展示了在保持模型性能的同时大幅提升训练效率的可能性,为大模型的应用开辟了新的路径。

延伸阅读

  1. 解释自适应性系统中的强化学习决策:EARL库推出反事实解释工具
  2. PIKFNO:基于物理信息核函数的可解释神经算子框架
  3. 校准信任,而非更精准预测:不确定性融合的实证检验
查看原文