HyperWorld:超图状态序列化提升文本世界模型学习效率
近日,一篇题为《HyperWorld: Hypergraph-Structured State Serialization Improves Learned Textual World Models》的论文在 arXiv 上发布,探讨了文本环境中世界模型的状态序列化结构对学习效果的影响。该研究由 Yun-Jian Zhang 等十位作者共同完成,于 2026 年 6 月 12 日提交。
世界模型赋予语言模型代理预测环境动态和规划行动的能力,在文本环境中,模型需要从序列化的状态描述中学习符号动作效果。然而,序列化的具体结构如何影响学习效率,此前研究甚少。HyperWorld 通过受控实验,对比了原始观察与三种基于相同真实状态的符号序列化方式:独立句子、成对三元组以及以实体为中心的超边单元。所有变体采用相同的训练目标:给定状态和动作,预测符号效果或判断动作是否可行。
实验覆盖了不同模型规模、数据预算以及分布内和分布外测试世界。结果显示,超边序列化在 0.5B 至 1.5B 参数规模的模型上带来最显著的提升,尤其在分布偏移的情况下。模型规模增大时,不同序列化方式之间的差距逐渐缩小;在分布内精确匹配上,成对三元组甚至能持平或略超超边,但在分布外事实 F1 分数上,超边表现最强,并在中小规模下实现了可行性检测与效果预测之间的最佳权衡。在下游贪婪规划任务中,超边世界模型也取得了最高的成功率。
这些结果表明,高阶状态组织是一种简单却有效的归纳偏置,尤其当模型容量有限或测试环境与训练环境存在差异时,能够显著提升学习到的符号世界模型的性能。该研究为文本世界模型的序列化设计提供了新视角,未来或可探索更复杂的图结构或动态序列化策略。
论文共 10 页,包含 4 张图和 3 张表格,已提交至 arXiv:2609.00002。