Speko (YC S26):为语音 AI 打造的 OpenRouter,让模型选择不再盲目
语音 AI 正在快速成为人机交互的主流方式,但开发者常常面临一个棘手问题:该选哪个语音识别(STT)模型?哪个 LLM 最适合我的场景?哪个语音合成(TTS)模型在特定语言上表现更好?这些选择往往依赖厂商的英文榜单或直觉,缺乏客观、可比较的数据。
Speko 正是为解决这一痛点而生。这家 YC S26 孵化的初创公司,将自己定位为“语音 AI 的 OpenRouter”——一个智能路由网关,能根据你的约束条件(如成本、延迟、语言)自动选择最优的 STT、LLM 和 TTS 模型组合,并解释为什么选它。
核心功能:跨语言基准测试与智能路由
Speko 的核心是一个庞大的基准测试数据库,覆盖了 21 个 STT 模型、17 个 TTS 模型,以及多种 LLM,并且按语言细分,包括英语、阿拉伯语、法语、德语、印地语、挪威语、西班牙语、泰米尔语和泰卢固语等。它不只是给出单一的准确率,而是将词错率(WER)与成本(美元/分钟) 放在一起对比,让开发者一目了然。
例如,在 STT 领域,AssemblyAI 的 Universal-3.5 Pro 以 2.0% 的 WER 领先,但成本为 $0.0075/分钟;而 Modulate 的 Velma 2 虽然 WER 为 4.4%,但成本仅 $0.0010/分钟。Speko 的评分系统会告诉你,在“追求极致准确”还是“控制预算”的情况下,哪个模型更合适。
一个 API 接入所有提供商
Speko 最吸引人的地方在于它的网关设计:开发者只需一个 API 密钥和基础 URL,就能调用所有主流提供商的模型。它兼容 OpenAI API 协议,因此你现有的框架(如 LiveKit、Pipecat)几乎无需改动,只需切换主机名和模型名称即可。
实际体验:从演示到生产
创始人 Bek 在演示中展示了如何通过 Speko 在 LiveKit 中运行语音代理,代码几乎不变。这种“即插即用”的体验,大大降低了切换模型的成本,也让开发者可以灵活地根据实时需求调整模型组合。
行业影响与展望
语音 AI 市场正从“单一模型垄断”走向“多模型竞争”,Speko 的出现顺应了这一趋势。它让开发者不再被某个厂商锁定,而是可以像使用 OpenRouter 选择 LLM 一样,自由挑选最合适的语音模型。对于追求多语言支持和成本效益的团队来说,Speko 提供了一个客观、透明的决策工具。
当然,作为一个早期产品,Speko 的基准数据覆盖范围还在扩展中,中文等更多语言的基准测试尚未完善。但其理念和架构已经为语音 AI 的开发流程带来了新的可能性。
