SheepNav
精选今天0 投票

两个API设置让GPT-5.6在ARC-AGI-3基准测试中得分翻三倍

OpenAI 最新研究发现,通过启用 保留推理(retained reasoning)和 压缩(compaction)这两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分从 7.8% 飙升至约 23.4%,输出 token 数量减少了 6 倍。ARC-AGI-3 是一个衡量 AI 智能体学习和推理能力的 2D 益智游戏基准,此前 GPT-5.6 Sol 在该测试中表现不佳,仅解决第一关,而启用新设置后,它能通关全部六个关卡。

基准测试的隐藏变量

基准测试很少孤立地衡量 AI 模型,它们也衡量 API 设置、框架设计和提示词等不太显眼的选择。ARC-AGI-3 使用了一个故意通用的框架,没有工具或特殊功能,旨在让模型缺陷更明显、比较更公平。但商业开发者通常会针对每个模型的特性优化框架。OpenAI 发现,默认的通用框架无法发挥 GPT-5.6 Sol 的潜力——它曾在数学难题(如环双覆盖猜想)和复杂游戏(如《宝可梦 火红》)中取得突破。

设置如何发挥作用

  • 保留推理:让模型在生成最终答案前,保持内部推理链的完整,避免因截断或简化而丢失关键思考步骤。
  • 压缩:优化输出 token 的表示,去除冗余信息,使模型能更高效地利用上下文窗口。

两者结合,不仅大幅提升了推理质量,还显著降低了计算成本。输出 token 减少 6 倍,意味着响应更快、费用更低。

行业启示

这一发现提醒 AI 开发者:基准测试结果不仅反映模型能力,也受测试框架的显著影响。在评估模型时,应仔细审视 API 设置和交互方式,避免低估模型真实水平。对于应用开发者,合理配置 API 参数可能是解锁模型潜力的关键。

延伸阅读

  1. 一座被忽视的地热发电厂如何重获新生
  2. 开源引擎 TurboFieldfare:在任意 M 系列 Mac 上以 2GB 内存运行 Gemma 4 26B 模型
  3. 下载日报:芯片人才争夺战与AI泡沫的消退
查看原文