精选今天0 投票
机密GPU推理性能实测:NVIDIA H100在Intel TDX下的基准测试
随着AI推理任务处理敏感数据或保护专有模型资产的需求日益增长,机密计算正成为实际部署中的一项关键要求。然而,启用机密执行模式对GPU加速的大语言模型服务带来的性能代价,仍然高度依赖具体工作负载,且在运维层面至关重要。
一篇发表于arXiv的新论文(arXiv:2607.19353)对NVIDIA H100 80GB GPU在Intel TDX机密实例上的推理性能进行了基准测试。研究对比了标准非机密执行与机密计算模式,使用了Mistral-7B v0.1和Qwen3-30B-A3B两个代表性模型,测量了首Token延迟、端到端请求延迟、单请求Token生成吞吐量、全局Token吞吐量以及闭环请求吞吐量等关键指标。
主要发现
测试结果显示,机密模式会带来一致的性能损失,但整体仍能维持可用吞吐量。具体数据如下:
- 首Token延迟(TTFT):在固定请求速率实验中,机密模式使Mistral-7B的平均TTFT增加21.8%,Qwen3-30B-A3B增加27.8%。
- 全局Token吞吐量:机密模式下,Mistral-7B下降17.7%,Qwen3-30B-A3B下降21.1%。
- 闭环并发实验:吞吐量差距保持在**11.5%至20.2%**之间,但更大的模型(Qwen3-30B-A3B)在机密模式下更早达到饱和拐点。
行业背景与解读
机密计算通过硬件级隔离(如Intel TDX、AMD SEV-SNP、NVIDIA CC)保护数据和使用中的模型权重,对于金融、医疗、法律等合规严苛的行业尤为重要。随着大语言模型部署从实验走向生产,如何在安全与性能之间取得平衡成为关键决策点。
本研究的价值在于提供了量化参考:虽然机密模式会引入约20%左右的吞吐量下降,但并非不可接受。不过,容量规划必须考虑双重影响——稳态吞吐量损失和较大模型更早的饱和行为。这意味着运维团队需要预留额外的计算资源,或在调度策略上做出调整。
小结
对于计划采用机密GPU推理的团队,建议:
- 进行实测:不同模型和框架的表现可能差异显著。
- 关注饱和点:大模型在机密模式下并发能力下降更快,需重新评估最大并发数。
- 成本权衡:机密实例通常更昂贵,需将性能折扣纳入总拥有成本计算。
该研究为机密AI推理的性能建模提供了宝贵数据,也提示业界:安全与性能的取舍并非零和博弈,而是需要精细化的工程调优。