SheepNav
精选今天0 投票

双流Transformer:将预填充主路径与解码附加计算解耦

随着大语言模型(LLM)服务请求量的持续增长,推理成本在整个生命周期中的占比日益凸显,甚至超过一次性训练成本。然而,推理的两个阶段——预填充(prefill)和自回归解码(decode)——对硬件资源的需求截然不同:前者是并行计算,通常受限于算力;后者是顺序生成,往往受限于内存带宽。传统的模型扩展方式,无论是增加宽度还是深度,都会同时增加两个阶段的成本,因为每一层网络在预填充和解码阶段都会被完整计算。

针对这一痛点,来自佐治亚理工学院等机构的研究者提出了一种名为 Dual-Flow Transformer 的新架构,其核心思想是将用于处理提示词(prompt)的主计算路径与用于生成续写(continuation)的附加计算解耦。该架构包含两个流:主流(primary flow)是一个完整的因果语言模型,负责处理提示词并写入键值(KV)缓存;辅助流(auxiliary flow)在预填充阶段完全不参与计算,仅在提示词处理完毕后的最后一个位置开始激活,专门用于增强续写预测能力,且不写入持久状态,也不影响主流的计算。

这种设计的关键优势在于,两个流共享大部分注意力、MLP和输出矩阵,但使用独立的词嵌入和轻量级耦合。共享权重和主缓存意味着在分组执行时,可以复用已加载的权重和缓存的键值对,从而提升计算效率。实验表明,在匹配 token 数量的条件下,Dual-Flow 能够在多种架构和数据配置下实现更低的验证损失。

尤其值得一提的是,在混合专家(MoE)模型中,这种分离使得主专家和辅助专家的扇出(fan-out)可以独立控制,从而分别调节提示成本、续写成本和预测质量。研究者探索了两种模式:固定预填充专家计算量而增加解码计算量,以及将固定的解码专家预算在两个流之间重新分配。这些实验揭示了预填充与解码质量之间的权衡关系,并展示了按阶段分配专家资源的巨大潜力。

这项研究为降低 LLM 推理成本提供了新的思路,即不再盲目增加模型规模,而是针对不同推理阶段的特点,动态地分配计算资源。未来,这一架构有望在保证生成质量的同时,显著提升推理效率,尤其适用于长上下文和持续生成场景。

延伸阅读

  1. 不想让大模型建议核打击?试试用日语提问
  2. 我们需要实用的AI对齐方法:让AI推理像人类一样
  3. 移动边缘计算中的多智能体调度:LLM辅助契约网协商新方法
查看原文