Anthropic 发布 Claude Sonnet 5.5:速度提升 30%、成本降低 30%,Terminal-Bench 得分从 10.3% 跃升至 70.6%
Anthropic 正式发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型。官方称其为 Sonnet 5 的"明确升级"——生成速度提升 30% 以上,完成同等任务成本最多降低 30%,同时保持了与 Sonnet 5 相同的定价(每百万输入 token 2 美元、输出 10 美元、缓存读取 0.20 美元)。
性能跃升:从 10.3% 到 70.6%
最引人注目的数据来自 Terminal-Bench 4.0——一项智能体编程评测。Sonnet 5.5 得分 70.6%,而 Sonnet 5 仅为 10.3%,提升幅度超过六倍。在衡量多种职业真实工作表现的 GDPval-AA 测试中,Sonnet 5.5 仅比旗舰模型 Opus 5.5 低两分。
长时程任务与图像理解方面同样有突破:Sonnet 5.5 成为首个仅凭截图就能通关《宝可梦 红》的 Sonnet 系列模型。Anthropic 还特别提到它对设计有"敏锐的眼光",适合制作文档、幻灯片和电子表格。
定位与协作能力
Sonnet 5.5 被定位为 Opus 5.5 的"更快、更低成本的补充"。Opus 5.5 面向需要审慎判断的复杂工作,而 Sonnet 5.5 则擅长边界清晰的日常任务、修 bug 以及产出打磨过的办公文档。早期测试者反馈,其文字表达比前代更清晰,是"更好的协作伙伴",速度优势也使其适合在不太复杂的任务上快速迭代。
安全与后续计划
安全方面,Sonnet 5.5 在自动化行为审计的大多数指标上持平或优于 Sonnet 5。由于网络安全能力与 Opus 5 相当,它成为首个搭载网络防护与回退机制的 Sonnet 模型;生物安全防护则与 Sonnet 5 一致。两类防护仅针对少数高风险请求,常规软件开发与大部分生命科学工作不受影响。
面向高并发、成本敏感场景的 Claude Haiku 5.5 将在未来几周内加入 Claude 5.5 家族。
值得注意的是,Anthropic 也坦承基准分数只能反映模型能力的一个侧面,在实际测试中 Opus 5.5 仍然保持明显优势。对于需要日常高频调用、又对成本敏感的开发者而言,Sonnet 5.5 在性价比上的提升值得关注。
