新上线今天0 投票
LARA:残差流中的轻量适配器,实现可组合的模型微调与对齐
在大型语言模型(LLM)微调领域,LoRA 及其变体已成为事实标准,其核心思想是在权重矩阵上添加低秩更新,以极小的参数量实现高效适配。然而,LARA(Lightweight Additive Residual Adaptation)提出了一种截然不同的思路:将适配过程从权重空间转移到残差流中。
LARA 的运作机制是,在冻结的基础模型上,于少量特定层读取隐藏状态,并添加一个低秩的校正项至残差流,从而改变模型的输出行为。所有基础权重均保持不变。这种设计带来了几个独特优势:
- 可插拔与可组合:由于适配模块独立于基础模型,多个行为模块可以同时驻留在内存中,系统可根据每个 token 自动路由选择相应的模块。论文展示了在单个冻结的 1.5B 模型上,同时部署七个行为(六个微调任务 + 一个偏好优化),总开销仅约 33 MB,而传统方法需要为每个行为保存一个完整模型。
- 平滑的控制旋钮:LARA 暴露了一个缩放因子 γ,可在推理时动态调整,用于在基础行为与适配行为之间进行平滑插值。这种细粒度的控制是权重空间适配(如 LoRA)难以实现的,为模型行为调节提供了新的工具。
- 性能媲美 LoRA:在代码微调和偏好优化(DPO)任务上,LARA 在相同参数数量下达到了与 LoRA 相当的性能。
从更广的视角看,LARA 代表了一种模块化模型设计的趋势。它允许不同任务、不同领域甚至不同用户偏好的适配器像乐高积木一样自由组合,而无需重新训练或加载多个完整模型。这对于边缘设备上的多任务部署、个性化服务以及持续学习场景尤其具有吸引力。
当然,LARA 仍处于早期研究阶段,其在不同模型规模、更多任务类型上的泛化能力,以及与量化、剪枝等其他压缩技术的兼容性,仍需进一步探索。但不可否认,LARA 为高效模型适配提供了一个新颖且富有潜力的方向,值得 AI 从业者密切关注。

