SheepNav
新上线今天0 投票

查询知道该遗忘什么:线性注意力中的第二擦除方向

线性注意力模型因其固定大小的状态表示,在长上下文场景下面临着信息干扰的挑战。近日,Dhruman Gupta等人提出了一种名为QED的新方法,通过引入查询衍生的擦除方向,显著提升了模型的检索能力,甚至将有效上下文长度翻倍。

背景:线性注意力的困境

传统的Softmax注意力机制虽然效果出众,但其计算复杂度随序列长度呈二次方增长,难以应对超长上下文。线性注意力通过固定大小的状态来近似全局信息,将复杂度降至线性。然而,这种压缩也带来了问题:当上下文极长时,大量信息被挤压在有限的状态中,相互干扰,导致检索准确率急剧下降。

QED:从查询中寻找擦除方向

现有方法(如Gated DeltaNet-2)在进行状态更新时,擦除向量仅由当前token的键(key)决定。但研究者发现,读取时干扰的度量依赖于查询(query),而键导向的擦除无法触及查询方向上的干扰。QED的灵感正是来源于此:既然查询能感知干扰,那么它也应该指导擦除。

QED在原有键导向擦除的基础上,增加了一个与键正交的、由查询衍生的第二擦除方向。在快速权重视角下,这种设计使得模型能够利用可编辑的部分,沿查询方向抵消旧状态中的干扰内容,从而更精准地更新记忆。

性能提升:不止一点

实验表明,QED在多种长度超出训练窗口的测试中均提升了检索性能,尤其在S-NIAH-1任务上,有效上下文长度几乎翻倍。这意味着,在不改变模型架构的前提下,仅通过修改擦除机制,就能显著扩展线性注意力的可用范围。

未来展望

QED为线性注意力模型的优化提供了新思路:擦除不应仅依赖键,查询中的信息同样重要。这一发现或许能启发更多关于注意力机制内部信息流的研究,推动高效长上下文模型的进一步发展。

延伸阅读

  1. 对比学习赋能对撞机实验:可解释异常检测新框架ORCA
  2. 鲁棒双模型协作随机向量功能链接网络
  3. 困难样本与坏标签:不确定性采样在标签噪声下的表现测试
查看原文