MARCH:以内容路由的状态锚点扩展循环记忆,兼顾效率与长程检索
Transformer 凭借随上下文长度增长的 token 级记忆,在长上下文检索任务中表现卓越,但代价是训练时的二次计算复杂度和推理时线性增长的 KV 缓存。循环神经网络(RNN)类模型通过将全部历史压缩为固定大小的状态来实现高效解码,却常在需要精确回忆的任务中败下阵来——早期信息往往被后续更新覆盖,模型只记得最近的内容。
针对这一矛盾,来自清华大学、上海交通大学等机构的研究者提出了 MARCH(Memory-Anchor Routing across Context History) 架构,在保持循环模型高效推理的同时,让记忆容量能随上下文长度灵活扩展。其核心思想是:周期性将累积的循环状态检查点保存为“状态锚点”,并为每个锚点生成一个紧凑的内容相关键(anchor key)。这样,模型就拥有一个可增长的内存库,用户可以在历史分辨率和内存开销之间进行可控的权衡。
具体而言,在每个时间步,MARCH 会生成一个锚点查询(anchor query),对所有因果可用的状态锚点进行注意力聚合,输出则是对所有历史锚点沿当前状态进行注意力式加权求和的结果。这种设计让模型在保留循环计算路径的同时,能够直接“回看”较早的状态锚点,从而缓解信息覆盖问题。
实验结果显示,在标准预训练后,MARCH 在常识推理、LongBench 和上下文检索等多个基准上一致优于多种线性注意力变体。这表明,内容路由的状态缓存能显著增强循环模型的长程记忆能力,同时不破坏其固有的高效计算路径。
这项研究的价值在于,它提供了一种新的思路来平衡效率与性能:既不像 Transformer 那样完全依赖随长度增长的显式记忆,也不像传统 RNN 那样将记忆压缩到固定大小,而是通过锚点机制实现一种“可扩展的循环记忆”。这对于长文本处理、多轮对话、代码生成等需要长程依赖的应用场景,可能带来更实用的解决方案。
当然,该工作目前仍处于 arXiv 预印本阶段,其实际效果和可扩展性尚需进一步验证。但 MARCH 所展示的方向——在循环架构中引入内容寻址的记忆缓存——无疑为高效长上下文建模提供了新的可能。