精选今天0 投票
AutoWorldModel-Bench:以状态为中心的自动世界模型研究基准
世界模型研究领域目前仍处于探索阶段,架构、训练目标和状态表示之间的相互作用复杂,且没有一种通用方案能在所有环境中占据主导。这使其成为评估AI编程代理作为自主研究者的理想测试平台——在这种设定下,改进方向并非预先指定,这与当前主导代理基准的工程规格任务不同。我们推出了AutoWorldModel-Bench,这是一个闭环基准,前沿编码代理在固定计算预算下自主改进提供的世界模型起点。该基准涵盖八个游戏环境,统一采用结构化状态表示——从每个游戏中提取的真实实体状态,通过共享张量格式消费——从而将动态建模与感知分离,实现每次运行仅需数分钟的迭代。在64个会话中,Codex-5.4和Claude Opus 4.6在63个会话中改进了起点;在91%的会话中,获胜编辑是非平凡的研究型修改——新目标、新表示、新回滚流程或架构变更——而非超参数调整。我们的基准提供了一个场景,在此场景中,前沿编码代理可以在开放式研究而非工程规格问题上接受评估。