新上线今天0 投票
FourierQK:滤波器形状、可容许性与泄漏-覆盖定律
当注意力机制遇上傅里叶滤波
标准 Transformer 的注意力依赖 Q/K 点积,而 Frequency-collapse attention 提出了一种替代方案:用学习到的频率上的带通滤波内积取代点积,并在实验中取得显著增益。arXiv 最新论文 FourierQK 进一步追问:滤波器形状究竟如何影响效果?作者 Athanasios Zeris 通过控制变量消融实验,给出了五个关键发现。
五个核心发现
论文在 TinyShakespeare 字符级语言建模任务上,使用 6 层 GPT 架构,测试了关于滤波器属性的五组假设:
- DC 与 Nyquist 分量有害:验证损失约为 2.0,与相位随机化相当,说明振荡带通结构不可或缺,并非任意低维频谱摘要都能奏效。
- 最优单尺度带宽 σ ≈ 2 bins:中心频率位于段落尺度(约 70 个 token),相比 BASE-DOT 获得 +1.15 nats 的干净增益。
- 可容许滤波器更优:零均值、墨西哥帽 DOG(m=2)在同尺度下优于非可容许高斯滤波器,并能部分抵御双边 FFT 泄漏。
- 泄漏-覆盖定律:双边 FFT 泄漏随频谱覆盖单调增加——窄带滤波器(gap > +4)干净,宽带滤波器(gap < +2)泄漏严重。
- 因果 Morlet 的局限:字符尺度下的因果时域 Morlet 无法超越 BASE-DOT(K=128 taps 仅覆盖 T=256 上下文的 50%),这促使作者在配套论文 MorletQK 中转向词级实验。
适用场景与边界
综合来看,FourierQK 在双向注意力场景(如 BERT 类编码器)中表现有效,因为训练和推理时均可获得完整序列上下文。但自回归生成(如 GPT 类解码器)需要因果频谱变体,即 MorletQK。这一区分对实际部署至关重要。
行业意义
这项工作为注意力机制设计提供了频谱视角的严谨分析,将信号处理中的滤波器理论引入 Transformer 架构搜索。泄漏-覆盖定律尤其具有指导价值:它量化了频谱覆盖与信息泄漏之间的权衡,为后续高效注意力变体提供了可复用的设计准则。代码已开源,配套 MorletQK 论文值得关注。
