SheepNav
新上线今天0 投票

拓扑感知的数据移动:解耦GPU推理的新思路

随着大语言模型(LLM)规模的不断膨胀,传统的单体GPU推理模式正面临严峻挑战。为了提升资源利用率和系统吞吐,将预填充(prefill)和解码(decode)阶段分离到不同的GPU池已成为一种趋势,即所谓的“解耦推理”(disaggregated inference)。然而,这一架构转变也带来了一个此前被忽视的关键问题:KV缓存(KV cache)需要在不同GPU池之间高效传输。以70B模型为例,每个请求的KV缓存高达2.6GB,在规模化部署时,聚合带宽需求轻松超过100GB/s。

但现有系统如DistServe、Splitwise和Mooncake,均采用统一的RDMA(远程直接内存访问)进行数据传输,完全忽略了物理拓扑对带宽的巨大影响。事实上,根据GPU之间的物理关系,带宽差异可达72倍:同一NVLink域内的GPU间带宽高达900GB/s,跨节点的InfiniBand仅为50GB/s,而跨数据中心的TCP连接只有12.5GB/s。这种“一刀切”的做法,无疑是对基础设施性能的极大浪费。

针对这一痛点,一篇来自arXiv的最新论文提出了一种拓扑感知的传输编排器(topology-aware transfer orchestrator),旨在根据互连拓扑动态选择最优传输路径。该设计包含三个关键机制:流水线式逐层传输,通过将KV缓存按层切分并重叠传输与计算,可隐藏60%到85%的传输延迟;NVLink域感知的MoE模型放置,在混合专家(MoE)模型中,将专家调度与KV缓存本地性协同优化;以及利用CXL 3.0内存扩展器作为共享溢出层,相比NVMe提供6倍容量和86倍更低的延迟。

不过,作者也坦言,完整的评估需要多节点异构集群和CXL 3.0硬件,这在学术环境中难以实现,GPU云也尚未提供支持。因此,论文目前仅提供了分析性带宽模型、组件实现以及基于三种架构的投影分析,结果显示,相比统一RDMA,传输延迟可降低3至18倍

尽管尚未经过真实环境验证,但这项工作无疑为解耦推理的通信瓶颈提供了极具价值的理论框架和实现思路。随着CXL等新型互连技术的成熟,拓扑感知的数据移动或将成为未来AI基础设施的关键一环。

延伸阅读

  1. AI音乐应用是否泄露了夏日之歌的秘密?
  2. 美国公司AI赋能乌克兰廉价自杀式无人机,实现自主追踪目标
  3. Ember智能保温杯2代:让咖啡数小时保持温热,现正促销
查看原文