SheepNav
精选今天314 投票

Anthropic 发布 Claude Sonnet 5.5:速度提升 30%、成本降低 30%,Terminal-Bench 得分从 10.3% 跃升至 70.6%

Anthropic 正式发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型。官方称其为 Sonnet 5 的"明确升级"——生成速度提升 30% 以上,完成同等任务成本最多降低 30%,同时保持了与 Sonnet 5 相同的定价(每百万输入 token 2 美元、输出 10 美元、缓存读取 0.20 美元)。

性能跃升:从 10.3% 到 70.6%

最引人注目的数据来自 Terminal-Bench 4.0——一项智能体编程评测。Sonnet 5.5 得分 70.6%,而 Sonnet 5 仅为 10.3%,提升幅度超过六倍。在衡量多种职业真实工作表现的 GDPval-AA 测试中,Sonnet 5.5 仅比旗舰模型 Opus 5.5 低两分。

长时程任务与图像理解方面同样有突破:Sonnet 5.5 成为首个仅凭截图就能通关《宝可梦 红》的 Sonnet 系列模型。Anthropic 还特别提到它对设计有"敏锐的眼光",适合制作文档、幻灯片和电子表格。

定位与协作能力

Sonnet 5.5 被定位为 Opus 5.5 的"更快、更低成本的补充"。Opus 5.5 面向需要审慎判断的复杂工作,而 Sonnet 5.5 则擅长边界清晰的日常任务、修 bug 以及产出打磨过的办公文档。早期测试者反馈,其文字表达比前代更清晰,是"更好的协作伙伴",速度优势也使其适合在不太复杂的任务上快速迭代。

安全与后续计划

安全方面,Sonnet 5.5 在自动化行为审计的大多数指标上持平或优于 Sonnet 5。由于网络安全能力与 Opus 5 相当,它成为首个搭载网络防护与回退机制的 Sonnet 模型;生物安全防护则与 Sonnet 5 一致。两类防护仅针对少数高风险请求,常规软件开发与大部分生命科学工作不受影响。

面向高并发、成本敏感场景的 Claude Haiku 5.5 将在未来几周内加入 Claude 5.5 家族。

值得注意的是,Anthropic 也坦承基准分数只能反映模型能力的一个侧面,在实际测试中 Opus 5.5 仍然保持明显优势。对于需要日常高频调用、又对成本敏感的开发者而言,Sonnet 5.5 在性价比上的提升值得关注。

延伸阅读

  1. AI 真的做出了科学发现吗?Anthropic 的声明引发学界争议
  2. AI 代理失控谁担责?MIT 科技评论推出 AI 炒作指数
  3. AI智能体失控,谁来担责?
查看原文