新上线昨天232 投票
OpenAI GPT-6 Astra 在 ARC-AGI-3 基准测试中展现接近人类效率的智能体能力
近日,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了显著成绩,引发了 AI 社区的广泛关注。据测试组织方发布的报告,GPT-6 Astra 在标准测试环境下(允许模型携带笔记)得分为 62.7%,成本约 2.6 万美元;而在使用 Provider Adapter 测试环境(保留不透明推理状态并使用压缩技术)时,得分跃升至 99.9%,成本约 1.9 万美元。值得注意的是,GPT-6 Astra 在动作效率上超越了人类基线:在 96% 的关卡中,它使用的动作数少于测试人类的中位数。
ARC-AGI-3 是 ARC-AGI 基准系列的第三代,旨在评估智能体在新型抽象回合制环境中的能力,包括探索、建模、目标设定和规划执行。该测试被认为能更好地反映真实世界任务中的智能水平。GPT-6 Astra 的关键表现之一是它能够将不熟悉的环境转化为紧凑的符号世界模型,将游戏机制表示为逻辑规则,并发展出自己的领域特定语言来跟踪状态和规划行动。
这一结果展示了大型语言模型在智能体任务上的巨大潜力,但同时也引发了对基准测试方法和模型能力的讨论。有评论指出,不同测试环境(如标准与 Adapter)之间的分数差异巨大,可能反映了模型在利用外部记忆或推理状态方面的能力差异。此外,尽管得分惊人,但模型在部分关卡上仍未达到完美,且成本高昂,其实际应用价值仍需进一步探索。
无论如何,GPT-6 Astra 的表现标志着 AI 在模拟人类式推理和行动效率方面迈出了重要一步,也为未来 AGI 的研究提供了新的视角。
