SheepNav
新上线今天0 投票

超越单一维度压缩:大语言模型的复合稀疏性前沿

大语言模型(LLM)的压缩通常依赖静态参数剪枝或动态令牌级计算,但过度稀疏化会导致性能急剧下降。最新研究提出了一种复合稀疏性框架,通过结合低秩近似、通道剪枝与逐令牌动态层跳过,将压缩负担分散到多个维度,从而延缓性能衰减。

研究背景与动机

现有LLM压缩方法主要分为两类:静态压缩(如参数剪枝、低秩近似)和动态压缩(如条件计算、令牌级层跳过)。然而,单一维度的稀疏化在达到某个临界点后,性能会迅速恶化。研究者猜想,将两种机制结合可能通过分担压缩压力来推迟这一衰减点。

复合稀疏性框架

该框架分两步实施:

  1. 静态压缩:先通过低秩近似和通道剪枝获得一个静态压缩的骨干网络。
  2. 动态压缩:引入轻量级路由器,为每个令牌动态决定是否跳过某些层。

这种设计使得参数稀疏性和令牌级计算稀疏性可以独立控制,从而探索更优的压缩组合。

实验结果

在语言理解和建模基准测试中,复合稀疏性在相同总稀疏度下始终优于单一机制压缩:

  • 在理解任务上,性能衰减点明显推迟。
  • 在建模任务上,保持了更强的性能。

进一步分析揭示:

  • 跨维度干扰:参数剪枝与令牌跳过之间存在相互影响。
  • 最优分配:在固定稀疏预算下,接近平衡的分配最为有效。

结论与意义

这项工作证明了复合压缩是提升LLM压缩效率的实用路径,同时揭示了更广泛的跨维度稀疏性边界,该边界最终限制了进一步压缩的可能性。代码将在论文链接中开源。

延伸阅读

  1. 偏好条件化多目标强化学习:实现运行时可调的公交信号优先控制
  2. E-SpecFormer:专为边缘端射频频谱监测设计的轻量Transformer
  3. 压缩关键信息:神经元重要性结合数据感知低秩近似,大模型压缩新突破
查看原文