SheepNav
精选今天0 投票

DC-Leap:无需训练的dLLM加速新方法,最高提速105倍

扩散大语言模型(dLLMs)正成为生成式AI领域的新焦点,但推理速度慢始终是制约其落地的瓶颈。近期,来自中国多所高校的研究团队提出了一种名为 DC-Leap 的训练无关加速框架,在标准基准测试中实现了最高 105.02倍 的推理加速,且生成质量基本不变。

痛点:保守阈值与冗余迭代

dLLMs 的核心优势在于其并行解码能力,但现有加速策略普遍存在一个问题:置信度阈值设置过于保守。这背后是所谓的“联合概率依赖误差”(JPDE)——由于并行解码时无法准确捕捉token间的因果依赖关系,模型不得不采用更严格的阈值来保证生成质量,结果导致大量去噪迭代变得冗余,推理效率大打折扣。

DC-Leap 的创新:两步走破解依赖难题

DC-Leap 框架包含两大核心机制,旨在安全地突破保守阈值限制:

  1. 动态连续验证(Dynamic Contiguous Verification):该方法将严格有序的因果约束直接融入并行解码过程。通过逐步验证token之间的依赖关系,DC-Leap 能够有效消除 JPDE 带来的不确定性,从而在中等置信度区间内实现可靠加速,同时保持与原始模型相当的性能。

  2. 草稿引导解码(Draft-Guided Decoding):借助一个“草稿”模型先行生成多个连续token,为后续解码提供“前瞻上下文”。这种机制不仅扩展了上下文窗口,还能保留双向注意力在推理时的结构优势,进一步提升长序列生成场景下的效率。

实测表现:长序列生成尤为亮眼

实验在多个标准基准上进行。在短序列任务中,DC-Leap 的加速比相对温和;但在长序列生成任务上,优势极为突出:

  • MBPP(代码生成)任务中,加速比达到 53.19倍
  • 若结合 KV-Cache 优化,整体加速比可飙升至 105.02倍

值得注意的是,这些加速是在不牺牲生成质量的前提下实现的——论文指出,DC-Leap 在多个评测指标上与原始 dLLM 表现相当,甚至在某些场景下略有提升。

行业意义:dLLM 实用化的关键一步

dLLMs 凭借其独特的反向扩散过程,在可控生成、多模态融合、逆向推理等任务上展现出传统自回归模型难以比拟的优势。然而,推理效率一直是其走向工业级应用的“阿喀琉斯之踵”。DC-Leap 提供了一种无需额外训练、即插即用的加速方案,意味着现有 dLLM 模型可以直接受益,无需重新训练或大幅改动架构。

局限与展望

目前 DC-Leap 的加速效果在长序列场景下最为显著,短序列或小批量任务中的收益相对有限。此外,草稿模型的质量直接影响最终加速比,如何自适应地调整草稿策略,可能是后续优化的方向。

论文及代码已公开,研究团队表示将继续探索 DC-Leap 在更大规模 dLLM 及多模态扩散模型上的应用。对于 AI 基础设施团队而言,这无疑是一个值得关注的效率提升工具。

延伸阅读

  1. DecodeShare:追踪LLM解码时刻共享子空间的新方法
  2. InferenceBench:AI智能体在开放式大模型推理优化中的真正能力测试
  3. JAXBench:为TPU内核自动优化设立新标杆
查看原文