新上线今天0 投票
利用 NVIDIA MPS 在 Amazon EC2 上将 ASR 推理成本降低 75%
大规模服务自动语音识别(ASR)模型时,如果每个请求仅使用 GPU 的一小部分,成本会非常高昂。了解如何将 NVIDIA CUDA 多进程服务(MPS)与 Amazon EC2 GPU 实例上的 NVIDIA Triton 推理服务器结合使用,将 GPU 基础设施削减 75%,同时保持每 GPU 每秒 92.1 个请求的亚秒级延迟。
大规模服务自动语音识别(ASR)模型时,如果每个请求仅使用 GPU 的一小部分,成本会非常高昂。了解如何将 NVIDIA CUDA 多进程服务(MPS)与 Amazon EC2 GPU 实例上的 NVIDIA Triton 推理服务器结合使用,将 GPU 基础设施削减 75%,同时保持每 GPU 每秒 92.1 个请求的亚秒级延迟。