SheepNav
新上线今天0 投票

ExFold:无需训练的MoE推理加速新框架,兼顾预填充与解码阶段

ExFold:统一专家折叠,让MoE推理更快一步

混合专家(MoE)模型通过稀疏专家激活,在保持每个token计算量可控的同时扩展模型容量,成为大语言模型领域的热门架构。然而,低延迟的MoE服务面临一个棘手挑战:推理过程分为两个阶段,且瓶颈截然不同——预填充阶段受限于按token计算的专家计算量,而解码阶段则受限于按批次激活专家集合的内存访问量。

现有的免训练加速方法往往只优化单一资源指标,要么优化每个token执行的专家数量,要么优化批次激活的专家集合,并且要么直接丢弃被排除专家的贡献,要么仅隐式近似。这种“偏科”做法难以同时兼顾两个阶段的性能。

针对这一痛点,北京大学等机构的研究人员提出了ExFold——一个统一的免训练专家折叠框架,旨在同时加速MoE的预填充和解码阶段。相关论文已提交至arXiv(编号2608.24938)。

核心思路:预算约束下的输出近似

ExFold将预填充和解码统一为带预算的输出近似问题:仅执行特定阶段约束下的专家子集,同时通过校准的标量投影器,将预算外专家的贡献“折叠”到保留的专家上。这一设计的灵感源于一个观察:许多专家输出在方向上具有一致性,但幅度不同。因此,ExFold在无标注数据上校准一个成对标量投影矩阵,推理时利用该矩阵将排除专家的贡献并入保留专家。

在该框架下,预填充加速变为token级的Top-K折叠,解码加速变为批次级的专家池折叠。两个阶段仅在选择保留专家的方式上不同,而排除专家的贡献恢复则共享同一折叠机制。

实现与效果

ExFold已作为即插即用插件集成到vLLM中,并包含轻量级的专家折叠CUDA内核。实验结果显示,ExFold能带来高达1.41倍的TTFT(首token延迟)2.45倍的TPOT(每token输出延迟) 加速,同时保持约99%的原始平均质量

行业意义

MoE模型的部署成本一直是实际应用中的关键挑战。ExFold通过统一视角简化了加速流程,无需重新训练即可直接应用,对于已部署的MoE模型来说,是一种低成本、高效率的优化方案。随着MoE模型在GPT-4、Mixtral等中的广泛应用,这类推理优化技术将有助于降低服务成本、提升用户体验。

不过,该论文目前为预印本状态,尚未经过同行评审,其实际效果和可复现性有待进一步验证。但无疑,ExFold为MoE推理加速提供了一条值得关注的新路径。

延伸阅读

  1. 动态影响加权蒸馏:仅用单臂IMU实现高效活动识别
  2. GreenLeaf Law Embed Tiny:为法律领域检索打造的紧凑型嵌入模型
  3. 多模态异常检测综述:从假设视角看技术演进与未来挑战
查看原文