SheepNav
新上线今天0 投票

在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(上):Qwen3-TTS 部署与双向流式实战

为什么实时语音应用需要「边生成边播放」

语音助手、互动教学、无障碍工具和客服机器人都有一个共同的体验痛点:等待。用户说完话后,如果系统要等整段回复全部生成完再播放,中间会出现明显的静默空档。流式语音合成(streaming TTS)正是为了解决这个问题——让语音在生成过程中就开始播放。

AWS 最新发布的技术教程展示了如何用 vLLM-Omni Deep Learning Container(DLC) 在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型,通过一条持久的双向连接同时完成文本输入与音频输出,并借助 Gradio 应用演示整个工作流。

什么是 vLLM-Omni DLC

vLLM 最初是为文本自回归生成设计的高性能推理框架,而 vLLM-Omni 将它的能力扩展到文本、音频、图像、视频等多模态模型的推理服务。AWS 提供的 vLLM-Omni DLC 在此基础上做了两件事:

  • 将跟踪的 vLLM-Omni 版本打包进 AWS 镜像,附带完整的框架依赖与部署配置;
  • 增加面向 SageMaker AI 的路由中间件,让容器可以直接对接 SageMaker 的双向流式接口。

这意味着开发者不需要自己拼装运行时环境,就能获得一条镜像化的路径,把多模态模型部署到 AWS 托管推理服务上。

这篇教程具体做什么

这是关于专用 DLC 系列文章的第一部分,后续还会覆盖 WhisperX 和 llama.cpp,第二部分则聚焦图像与视频生成。本篇的核心任务是语音输出侧:

  1. 克隆代码示例;
  2. 在 SageMaker AI 上部署 Qwen3-TTS 模型;
  3. 通过 SageMaker 双向流式(bidirectional streaming) 能力,在持久连接上发送文本、接收音频分块;
  4. 用 Gradio 应用实际体验流式语音效果。

与既有方案的关系

AWS 此前已有一篇教程演示语音管道的输入侧:将麦克风音频流式传输给 Voxtral-Mini-4B Realtime 语音转文本(STT)模型,并返回转写事件。本篇则补上了输出侧——把文本送给 Qwen3-TTS,再将生成的语音流式返回。两者结合,就构成了一个完整的实时语音交互回路。

值得关注的点

对于正在构建实时语音 Agent 的团队来说,这条路径的价值在于:托管服务 + 流式协议 + 多模态容器的组合,降低了自建推理集群的运维负担。不过教程目前只展示了 Qwen3-TTS 的部署与演示,实际生产中的延迟表现、并发能力和成本,还需要结合自身场景做基准测试。第二部分对图像和视频生成的覆盖,也值得持续跟进。

延伸阅读

  1. Shopify 向浏览器 AI 代理开放结账,让 AI 替你下单
  2. Claude Sonnet 5.5 登陆 AWS:更快、更省,专攻编码与知识工作
  3. OpenAI 的 AI 代理掉队了:DevDay 前夕,传闻中的「Aeon」能否翻盘?
查看原文