Kimi K3 在 AA-Briefcase 基准测试中仅次于 Fable 5,但成本高昂
表现强劲,但代价不菲
上周,Moonshot AI 发布了拥有 2.8 万亿参数 的模型 Kimi K3。在 Artificial Analysis 的智能指数中,Kimi K3 得分 57,与 Opus 4.8 和 GPT-5.5 等模型相当。但在他们全新的专有基准测试 AA-Briefcase 中,Kimi K3 以 Elo 1543 的成绩排名第二,仅次于 Anthropic 的 Claude Fable 5(Elo 1574),并大幅超越了前代 Kimi K2.6(+727 分)。
AA-Briefcase 专注于评估模型在知识工作场景中的代理能力,测试任务涵盖制作电子表格、演示文稿和 UI 原型等,基于数千个复杂输入文件的真实数据集。Kimi K3 在客观性和分析质量上表现出色,分析质量 Elo 达到 1754,与 Fable 5(1744)不相上下;正确性通过率为 51%,仅次于 Fable 5(56%)。然而,它在展示质量上相对较弱(Elo 1471),落后于 GPT-5.6 Sol 和 Opus 4.8。
成本与效率的权衡
尽管性能出众,Kimi K3 的运营成本却令人咋舌。其定价为 每百万输入/输出 token 3/15 美元(缓存 token 享 90% 折扣),但平均每项任务花费高达 10.57 美元,使其成为 AA-Briefcase 上运行成本最高的模型之一。这主要源于任务中大量的 token 消耗:平均每项任务需要 83 轮交互(Fable 5 为 67 轮,GPT-5.6 Sol 为 50 轮),输出 token 达 12 万。
时间成本同样不容忽视。Kimi K3 完成一项任务平均耗时 56.4 分钟,接近一小时,远超同类模型。这既与高轮次交互有关,也受限于其 API 的较低响应速度。
行业启示
Kimi K3 的发布再次印证了 AI 领域的“军备竞赛”已进入新阶段:模型参数规模持续膨胀,同时针对特定场景的基准测试(如 AA-Briefcase)变得更加精细化。然而,性能的跃升往往伴随着高昂的代价。对于企业和开发者而言,选择模型时必须在能力、成本和效率之间做出权衡。Kimi K3 在知识工作代理任务中展现了顶尖潜力,但在实际部署中,其成本和时间开销可能成为阻碍。
目前,Kimi K3 仅在 Moonshot AI 的 API 上可用,且仍处于快速迭代中。未来能否通过优化推理效率和定价策略来提升竞争力,值得关注。