长周期语言智能体的记忆为何呈重尾分布?一篇新论文提出Core-Tail世界模型
当记忆变成"冻结的世界模型"
长周期语言智能体(Long-Horizon Language Agents)越来越依赖外部记忆来充当一个"冻结的世界模型"。但长期以来,研究者评估记忆系统时,通常只看两个指标:任务成功率,以及 token 消耗。
来自 arXiv 的一篇新论文《Heavy-Tailed Memory Traces in Long-Horizon Language Agents》(作者:Xinyuan Song、Zekun Cai)指出,我们忽略了一个关键对象——记忆使用的形状。
核心发现:记忆会"扎堆"
在有限上下文窗口和反复检索的条件下,智能体的记忆使用会呈现出一种**重尾(heavy-tailed)**特征:
- 一小部分核心状态被高频访问,形成"核心(Core)"
- 大量稀有状态被留在长长的"尾部(Tail)"
- 恰恰是这些尾部状态,成为预测误差不断累积的地方
论文通过一种"保守的尾部审计"(conservative tail audit)验证了这一现象,并得出一个耐人寻味的结论:集中效应是可复现的,但依赖于具体策略。
具体来说:
- 随机游走智能体产生的检索痕迹符合对数正态分布
- 语义 LLM 策略则产生最明显的"截断幂律"核心—尾部痕迹
解决方案:Core-Tail World Model(CTWM)
基于这一审计结果,作者提出了Core–Tail World Model(CTWM)——一个基于排名的记忆控制器。它的核心思路是:
用一个单一的指数 τ 来分配 prompt 预算,同时保留一个经过摘要的尾部。
换句话说,不是简单地"只留核心、丢掉尾部",而是在压缩 token 的同时,为尾部保留一份摘要,从而不让稀有状态彻底消失。
实验数据
论文在多个基准上进行了测试,结果如下:
| 基准 | 效果 |
|---|---|
| Synthetic Graph World | 保留完整状态与转移覆盖,prompt token 减少 5.9%,下半尾部预测误差降低 13.6%(对比图记忆基线) |
| ALFWorld | 配对比较显示一致的 token 节省 |
| LongMemEval | token 减少 24.48%,总体准确率持平 |
为什么值得关注
这项工作的价值在于,它把"重尾记忆痕迹"从一个单纯的诊断信号,变成了一个可操作的控制信号。
在智能体越来越依赖长期记忆的当下,如何高效利用有限的上下文预算,是一个绕不开的工程难题。CTWM 的思路提示我们:与其纠结"该记住什么",不如先看清"记忆实际被怎么用"——记忆使用的分布形状本身,就是优化 token 效率的抓手。
论文目前处于审稿阶段(Under Review),代码与实验细节可查阅 arXiv 原文。