SheepNav
新上线今天0 投票

LoKiFormer:面向高效大语言模型预训练的局部感知注意力与解耦知识记忆

LoKiFormer 架构发布:预训练提速 1.33 倍,兼顾局部与全局知识

近日,一项名为 LoKiFormer 的新研究在 arXiv 上公开,并被 ICML 2026 接收。该研究针对当前大语言模型(LLM)预训练效率低下的问题,提出了一种全新的架构设计,通过引入局部融合注意力(LFA)与知识记忆模块(KMM),在信息整合效率上实现了显著提升。实验显示,LoKiFormer 在预训练阶段的收敛速度比基线模型快 1.33 倍,为 LLM 的高效训练提供了新思路。

现有 LLM 架构的两大瓶颈

尽管 LLM 在众多应用中表现卓越,但其预训练过程仍存在结构性缺陷。研究团队指出,两大问题尤为突出:

  • 自注意力缺乏局部归纳偏置:自注意力机制在处理序列内部信息时,没有显式地偏向局部模式,导致对局部信息的冗余建模,浪费计算资源。
  • 混合专家(MoE)中知识与计算耦合:MoE 隐式地将知识存储与计算路径绑定,使得模型难以灵活访问序列外部的全局知识,限制了知识利用的灵活性。

LoKiFormer 的解决方案:双模块协同

针对上述问题,LoKiFormer 在标准解码器上增加了两个专用模块:

  • 局部融合注意力(LFA):该模块将卷积融合引入注意力机制,显式捕捉局部模式,使注意力能够作用于更具信息量的表示,从而减少对序列内部局部信息的冗余建模。
  • 知识记忆模块(KMM):这是一个参数化的键值记忆系统,将全局知识显式存储在可寻址的槽位中,实现存储与计算解耦,支持直接的知识检索,增强了模型对全局知识的访问能力。

两个模块协同工作,使 LoKiFormer 能在局部与全局两个层面高效整合信息,兼顾效率与效果。

实验验证与行业意义

研究团队在预训练任务上对 LoKiFormer 进行了评估,结果显示其收敛速度比基线模型快 1.33 倍,证实了架构设计的优越性。这一成果不仅为 LLM 预训练效率的提升提供了可行路径,也对当前追求更大规模模型与更低训练成本的行业趋势具有重要意义。随着模型规模持续扩大,训练效率成为关键瓶颈,LoKiFormer 的局部感知与知识解耦思路,或将为下一代高效 LLM 架构的设计提供重要参考。

不过,该研究目前仍处于论文阶段,其实际应用效果与扩展性尚待进一步验证。未来,团队或许会开源代码并公布更多实验细节,以推动该架构在业界的落地。

延伸阅读

  1. Transformer残差流中的几何与行为分层:预测方向作为特权锚点
  2. 个性化评分建模:一种基于学习的多专家睡眠阶段标签生成框架
  3. 双时空归因:为循环图异常检测打造架构对齐的可解释性框架
查看原文