Tokenless:YC S26 新品发布,动态模型切换 API 网关,AI 支出直降 50%
一句话总结
Tokenless 是一个智能 API 网关,通过动态路由、并行推理和早期淘汰机制,在不牺牲输出质量的前提下将 AI 推理成本降低一半以上。
核心机制:用“并行试探”替代“盲目选择”
传统 LLM 调用通常固定使用某个模型(如 GPT-4o 或 Claude Opus),但 Tokenless 的做法完全不同:
- 当用户发起请求时,Tokenless 会同时向多个候选模型发送请求(如 GPT-4o、Claude Sonnet、Gemini Flash 等)。
- 它实时监控每个模型的推理过程,一旦某个模型明确给出正确方向的输出,就立刻选择该模型并取消其余请求。
- 用户只需为最终选中的模型付费,其他模型的早期推理成本由 Tokenless 承担(因其推理量极小且可被缓存复用)。
这相当于用“并行试探”代替“事前猜测”,用少量额外计算换取模型选择的最优解。
实测数据:质量持平,成本腰斩
Tokenless 在公开的 Agent 基准测试(如 τ³-Banking、Terminal-Bench、DeepSWE)上展示了惊人的性价比:
| 方案 | 解决率 | 平均每任务成本 |
|---|---|---|
| Tokenless Pro | 40.2% | $0.57 |
| GPT-5.6 Sol | 33.0% | $1.50 |
| Claude Opus 5 | 32.8% | $1.64 |
| Tokenless Ultra Saver | 30.9% | $2.25 |
| Claude Fable 5 | 26.8% | $2.58 |
| Gemini 3.6 Flash | 24.5% | $3.32 |
Tokenless Pro 在解决率最高(40.2%)的同时,成本仅为 GPT-5.6 Sol 的 38%,比 Claude Opus 5 便宜近 65%。
落地方式:零代码替换,兼容 OpenAI/Anthropic 接口
Tokenless 提供与 OpenAI 和 Anthropic 完全兼容的 API 端点,用户只需将代码中的 base_url 替换为 Tokenless 的地址,即可立即开始使用。无需修改模型调用逻辑,也无需调整 prompt。
团队背景与融资
Tokenless 由 Rohit、Andrew 和 Kev 三位联合创始人共同打造,团队来自 Google DeepMind、普林斯顿大学和 UC Berkeley,并获得 Y Combinator 投资。
成本节省测算:以每月 4 万美元支出为例
根据 Tokenless 官网提供的计算器,假设当前每月 LLM 支出为 $40K,使用 Tokenless 后:
- 新月度账单:约 $26K(节省 $14K,即 35%)
- 请求重路由比例:42%
- 未来 12 个月累计节省:约 $344K(假设 AI 支出以每月 11% 的增速增长)
注意:上述测算基于公开 Token 价格和可配置路由假设,实际节省因流量模式而异。
行业意义:AI 成本优化进入“路由时代”
随着大模型数量激增,企业面临的选择成本越来越高。Tokenless 的思路代表了一种新范式:不再依赖单一模型,而是通过智能路由动态组合多模型能力。这不仅降低了成本,也降低了供应商锁定风险。
对于 AI 应用开发者、SaaS 公司和内部 AI 平台团队来说,Tokenless 提供了一个即插即用的成本优化工具。随着模型推理价格持续下降,这种“模型路由”策略可能会成为标准实践。
如何体验
- 官网:usetokenless.com
- 支持预约演示,团队会针对实际流量进行成本测算
- 也支持直接替换两行代码自行验证