SheepNav
新上线今天52 投票

Tokenless:YC S26 新品发布,动态模型切换 API 网关,AI 支出直降 50%

一句话总结

Tokenless 是一个智能 API 网关,通过动态路由、并行推理和早期淘汰机制,在不牺牲输出质量的前提下将 AI 推理成本降低一半以上。

核心机制:用“并行试探”替代“盲目选择”

传统 LLM 调用通常固定使用某个模型(如 GPT-4o 或 Claude Opus),但 Tokenless 的做法完全不同:

  • 当用户发起请求时,Tokenless 会同时向多个候选模型发送请求(如 GPT-4o、Claude Sonnet、Gemini Flash 等)。
  • 它实时监控每个模型的推理过程,一旦某个模型明确给出正确方向的输出,就立刻选择该模型并取消其余请求
  • 用户只需为最终选中的模型付费,其他模型的早期推理成本由 Tokenless 承担(因其推理量极小且可被缓存复用)。

这相当于用“并行试探”代替“事前猜测”,用少量额外计算换取模型选择的最优解。

实测数据:质量持平,成本腰斩

Tokenless 在公开的 Agent 基准测试(如 τ³-Banking、Terminal-Bench、DeepSWE)上展示了惊人的性价比:

方案 解决率 平均每任务成本
Tokenless Pro 40.2% $0.57
GPT-5.6 Sol 33.0% $1.50
Claude Opus 5 32.8% $1.64
Tokenless Ultra Saver 30.9% $2.25
Claude Fable 5 26.8% $2.58
Gemini 3.6 Flash 24.5% $3.32

Tokenless Pro 在解决率最高(40.2%)的同时,成本仅为 GPT-5.6 Sol 的 38%,比 Claude Opus 5 便宜近 65%。

落地方式:零代码替换,兼容 OpenAI/Anthropic 接口

Tokenless 提供与 OpenAI 和 Anthropic 完全兼容的 API 端点,用户只需将代码中的 base_url 替换为 Tokenless 的地址,即可立即开始使用。无需修改模型调用逻辑,也无需调整 prompt。

团队背景与融资

Tokenless 由 Rohit、Andrew 和 Kev 三位联合创始人共同打造,团队来自 Google DeepMind、普林斯顿大学和 UC Berkeley,并获得 Y Combinator 投资。

成本节省测算:以每月 4 万美元支出为例

根据 Tokenless 官网提供的计算器,假设当前每月 LLM 支出为 $40K,使用 Tokenless 后:

  • 新月度账单:约 $26K(节省 $14K,即 35%)
  • 请求重路由比例:42%
  • 未来 12 个月累计节省:约 $344K(假设 AI 支出以每月 11% 的增速增长)

注意:上述测算基于公开 Token 价格和可配置路由假设,实际节省因流量模式而异。

行业意义:AI 成本优化进入“路由时代”

随着大模型数量激增,企业面临的选择成本越来越高。Tokenless 的思路代表了一种新范式:不再依赖单一模型,而是通过智能路由动态组合多模型能力。这不仅降低了成本,也降低了供应商锁定风险。

对于 AI 应用开发者、SaaS 公司和内部 AI 平台团队来说,Tokenless 提供了一个即插即用的成本优化工具。随着模型推理价格持续下降,这种“模型路由”策略可能会成为标准实践。

如何体验

  • 官网:usetokenless.com
  • 支持预约演示,团队会针对实际流量进行成本测算
  • 也支持直接替换两行代码自行验证

延伸阅读

  1. 扎克伯格预言:五年内将有数十亿人拥有个人AI助手
  2. 微软从Anthropic投资中获利32亿美元,OpenAI表现喜忧参半
  3. 扎克伯格:Meta的企业AI机遇远不止智能体
查看原文