SheepNav
新上线今天70 投票

Speko (YC S26):为语音 AI 打造的 OpenRouter,让模型选择不再盲目

语音 AI 正在快速成为人机交互的主流方式,但开发者常常面临一个棘手问题:该选哪个语音识别(STT)模型?哪个 LLM 最适合我的场景?哪个语音合成(TTS)模型在特定语言上表现更好?这些选择往往依赖厂商的英文榜单或直觉,缺乏客观、可比较的数据。

Speko 正是为解决这一痛点而生。这家 YC S26 孵化的初创公司,将自己定位为“语音 AI 的 OpenRouter”——一个智能路由网关,能根据你的约束条件(如成本、延迟、语言)自动选择最优的 STT、LLM 和 TTS 模型组合,并解释为什么选它。

核心功能:跨语言基准测试与智能路由

Speko 的核心是一个庞大的基准测试数据库,覆盖了 21 个 STT 模型、17 个 TTS 模型,以及多种 LLM,并且按语言细分,包括英语、阿拉伯语、法语、德语、印地语、挪威语、西班牙语、泰米尔语和泰卢固语等。它不只是给出单一的准确率,而是将词错率(WER)与成本(美元/分钟) 放在一起对比,让开发者一目了然。

例如,在 STT 领域,AssemblyAI 的 Universal-3.5 Pro 以 2.0% 的 WER 领先,但成本为 $0.0075/分钟;而 Modulate 的 Velma 2 虽然 WER 为 4.4%,但成本仅 $0.0010/分钟。Speko 的评分系统会告诉你,在“追求极致准确”还是“控制预算”的情况下,哪个模型更合适。

一个 API 接入所有提供商

Speko 最吸引人的地方在于它的网关设计:开发者只需一个 API 密钥和基础 URL,就能调用所有主流提供商的模型。它兼容 OpenAI API 协议,因此你现有的框架(如 LiveKit、Pipecat)几乎无需改动,只需切换主机名和模型名称即可。

实际体验:从演示到生产

创始人 Bek 在演示中展示了如何通过 Speko 在 LiveKit 中运行语音代理,代码几乎不变。这种“即插即用”的体验,大大降低了切换模型的成本,也让开发者可以灵活地根据实时需求调整模型组合。

行业影响与展望

语音 AI 市场正从“单一模型垄断”走向“多模型竞争”,Speko 的出现顺应了这一趋势。它让开发者不再被某个厂商锁定,而是可以像使用 OpenRouter 选择 LLM 一样,自由挑选最合适的语音模型。对于追求多语言支持成本效益的团队来说,Speko 提供了一个客观、透明的决策工具。

当然,作为一个早期产品,Speko 的基准数据覆盖范围还在扩展中,中文等更多语言的基准测试尚未完善。但其理念和架构已经为语音 AI 的开发流程带来了新的可能性。

延伸阅读

  1. 企业AI代理采用量今年增长三倍,可衡量ROI初现
  2. 隐藏AirTag揭露亚马逊销毁珍稀书籍以训练AI
  3. NVIDIA Nemotron 3.5 Lightning 登陆 Amazon SageMaker JumpStart,加速高并发 Agent 工作负载
查看原文