SheepNav
精选今天0 投票

长周期语言智能体的记忆为何呈重尾分布?一篇新论文提出Core-Tail世界模型

当记忆变成"冻结的世界模型"

长周期语言智能体(Long-Horizon Language Agents)越来越依赖外部记忆来充当一个"冻结的世界模型"。但长期以来,研究者评估记忆系统时,通常只看两个指标:任务成功率,以及 token 消耗。

来自 arXiv 的一篇新论文《Heavy-Tailed Memory Traces in Long-Horizon Language Agents》(作者:Xinyuan Song、Zekun Cai)指出,我们忽略了一个关键对象——记忆使用的形状。

核心发现:记忆会"扎堆"

在有限上下文窗口和反复检索的条件下,智能体的记忆使用会呈现出一种**重尾(heavy-tailed)**特征:

  • 一小部分核心状态被高频访问,形成"核心(Core)"
  • 大量稀有状态被留在长长的"尾部(Tail)"
  • 恰恰是这些尾部状态,成为预测误差不断累积的地方

论文通过一种"保守的尾部审计"(conservative tail audit)验证了这一现象,并得出一个耐人寻味的结论:集中效应是可复现的,但依赖于具体策略。

具体来说:

  • 随机游走智能体产生的检索痕迹符合对数正态分布
  • 语义 LLM 策略则产生最明显的"截断幂律"核心—尾部痕迹

解决方案:Core-Tail World Model(CTWM)

基于这一审计结果,作者提出了Core–Tail World Model(CTWM)——一个基于排名的记忆控制器。它的核心思路是:

用一个单一的指数 τ 来分配 prompt 预算,同时保留一个经过摘要的尾部。

换句话说,不是简单地"只留核心、丢掉尾部",而是在压缩 token 的同时,为尾部保留一份摘要,从而不让稀有状态彻底消失。

实验数据

论文在多个基准上进行了测试,结果如下:

基准 效果
Synthetic Graph World 保留完整状态与转移覆盖,prompt token 减少 5.9%,下半尾部预测误差降低 13.6%(对比图记忆基线)
ALFWorld 配对比较显示一致的 token 节省
LongMemEval token 减少 24.48%,总体准确率持平

为什么值得关注

这项工作的价值在于,它把"重尾记忆痕迹"从一个单纯的诊断信号,变成了一个可操作的控制信号。

在智能体越来越依赖长期记忆的当下,如何高效利用有限的上下文预算,是一个绕不开的工程难题。CTWM 的思路提示我们:与其纠结"该记住什么",不如先看清"记忆实际被怎么用"——记忆使用的分布形状本身,就是优化 token 效率的抓手。

论文目前处于审稿阶段(Under Review),代码与实验细节可查阅 arXiv 原文。

延伸阅读

  1. GPT-6 家族模型选型指南:从原型到生产,如何平衡成本与性能
  2. 自主AI重塑企业智能:2026年全球AI投资将达2.5万亿美元,但多数企业仍困于结构性孤岛
  3. MIT科技评论:生物逆龄竞赛开启,LLM推理能力遭DeepMind前成员质疑
查看原文