SheepNav
精选今天0 投票

编码智能体需要可执行世界模型、简化与验证来攻克 ARC-AGI-3 吗?

破解 ARC-AGI-3:编码智能体的核心能力归因研究

在人工智能领域,ARC-AGI(Abstraction and Reasoning Corpus)基准测试被视为迈向通用人工智能的重要关卡。此前,Sergey Rodionov 团队开发了一套集成可执行世界模型、计划性简化与精确回放验证的智能体,在 ARC-AGI-3 上取得了显著成绩。然而,这套系统究竟依赖哪项关键能力?最新预印本研究通过消融实验给出了答案。

四层嵌套实验设计

研究团队构建了四个基于 Codex 的智能体变体,层层剥离核心组件:

  • 文本基线:仅依赖纯文本推理,无任何世界模型或验证机制。
  • 灵活接口可执行世界模型:具备可执行世界模型,但移除回放验证。
  • 含简化功能的可执行模型:在上述基础上加入计划性简化能力。
  • 固定接口验证变体:保留简化与精确回放验证,要求完全复现记录观察。

所有变体在gpt-5.4 和 gpt-5.5 上以高(high)与极高(xhigh)两种推理强度进行测试,并在探索性实验中引入更强模型 gpt-5.6-sol

关键发现:组件效果因场景而异

最一致的结论是:更强的模型与更高的推理强度总能带来性能提升。但组件间的相对重要性出人意料:

  1. 可执行世界模型并非万能:在 gpt-5.5 设置下,纯文本变体反而优于带可执行世界模型的变体,表明强制要求持久化可执行产出可能带来开销。
  2. 简化功能在多数场景有效:在四种模型-强度组合中,简化功能提升了三种场景的性能,仅在最弱设置下无效。
  3. 完整验证变体全面领先:尽管消耗更多资源,验证变体在所有设置中均排名第一。

gpt-5.6-sol 下的饱和现象

在 gpt-5.6-sol 的探索实验中,验证变体在两种推理强度下完全解决了所有公开游戏,达到约 99% 的 RHAE,且总行动数仅为人类基线的一半以下。不过,由于该模型发布时间晚于这些游戏,且未见有隐藏集测试结果,这一表现应被视为公开集饱和,而非通用能力的证明。

行业启示

该研究为构建通用推理智能体提供了重要参考:

  • 验证机制是关键杠杆,尤其在高资源场景下价值显著。
  • 简化与可执行模型是辅助工具,但并非决定性因素。
  • 模型能力与推理强度仍是当前性能提升的最稳健路径。

随着 ARC-AGI 基准持续演进,如何在效率与泛化之间取得平衡,将是下一阶段的核心挑战。

延伸阅读

  1. 中国AI模型让特朗普的AI世界内部分裂
  2. 今日下载:AI招聘偏见,以及天气数据破坏风险
  3. 长时程模型时代的安全与对齐:OpenAI 从内部部署中学到的教训
查看原文