精选今天0 投票
六个月打造响应式语音AI实时系统:GPT-Live架构解析
语音AI中,知道何时开口比听起来更难。人类说话者能在瞬间无缝切换,但之前的语音AI系统无法跟上这种节奏。它们的基于轮次的架构依赖于称为轮次检测器的小型模型,这些模型面临艰巨任务:猜得太快,用户会被打断;猜得太晚,响应会显得迟缓。只有在检测器做出决定后,更大的LLM才能开始工作。
GPT-Live,我们的第三代语音系统,将轮次检测器从音频路径中移除。其语音模型是全双工的,这意味着它可以同时听和说。这消除了对单独检测器的需求,使对话感觉更即时、更自然。当需要更深层次的推理或工具使用时,GPT-Live还可以咨询我们的前沿模型,如GPT-5.5,而不会中断对话流程。这些能力共同赋予GPT-Live前所未有的对话响应性和智能组合。
为了大规模提供这种体验,需要一种针对低延迟优化的新系统架构。与典型的请求-响应推理不同,我们的系统将传入的音频流式传输到语音模型,并将传出的语音流式传输回用户,同时在单独的异步路径上处理委派。在过去的六个月里,我们重新设计了模型推理、上下文管理和媒体传输,以确保语音从端到端流畅流动。
该架构还在核心语音路径和应用程序逻辑之间创建了清晰的边界。这使得自定义应用程序行为变得容易,而不会影响响应性。这一基础为ChatGPT Voice中不断增长的功能提供了支持,包括新推出的在ChatGPT桌面应用中控制计算机和协调代理的能力。
在这篇文章中,我们将解释为什么早期的基于轮次的系统无法满足我们的需求,以及我们如何设计新系统以实现每一层的响应性。我们将涵盖有状态推理、动态上下文管理、异步委派和协议级优化,所有这些共同使GPT-Live真正“活”起来。
从轮次转向流式
早期的语音架构继承了文本LLM的基于轮次的特性,但每一轮都...
