SheepNav
新上线今天0 投票

利用 NVIDIA MPS 在 Amazon EC2 上将 ASR 推理成本降低 75%

大规模服务自动语音识别(ASR)模型时,如果每个请求仅使用 GPU 的一小部分,成本会非常高昂。了解如何将 NVIDIA CUDA 多进程服务(MPS)与 Amazon EC2 GPU 实例上的 NVIDIA Triton 推理服务器结合使用,将 GPU 基础设施削减 75%,同时保持每 GPU 每秒 92.1 个请求的亚秒级延迟。

延伸阅读

  1. 英伟达拟以130亿美元收购AI模型库Hugging Face
  2. AI高管跳槽潮再起:Thinking Machines联合创始人Barret Zoph转投Google
  3. AI行业抨击特朗普芯片税计划:'最愚蠢的竞争方式'
查看原文