HyenaND:原生多维亚二次算子,用输入依赖长卷积挑战注意力机制
告别一维“扫描”暴力:HyenaND 直接在高维空间做全局建模
Transformer 中的注意力机制虽然强大,但其二次方复杂度在处理长序列时成为瓶颈。近年来涌现出许多亚二次复杂度(subquadratic)的替代方案,但这些方案在处理图像、三维体积、偏微分方程(PDE)等多维数据时往往需要“妥协”:要么使用标准卷积,牺牲全局感受野和输入依赖性;要么将多维数据强行“拉平”成一维序列,再用循环模型(如 Mamba)扫描——这种一维光栅化顺序破坏了数据的空间结构。
HyenaND 的核心理念:让算子直接“理解”数据的原生几何结构。 它通过隐式参数化的全局、输入依赖的多维卷积核,直接在多维空间上执行操作,无需任何维度转换。这意味着图像仍是图像,体积仍是体积,它们的空间关系被完整保留。
技术亮点:隐式卷积核 + CUDA 优化
HyenaND 继承并扩展了 Hyena 家族的设计思路。其关键创新在于:
- 原生多维卷积:卷积核的尺寸覆盖整个输入域(全局),且其权重由输入数据动态生成(输入依赖),兼具注意力的灵活性和卷积的高效性。
- 亚二次复杂度:通过将卷积操作映射到频域(FFT),HyenaND 实现了 O(L log L) 的计算复杂度,L 为序列长度(多维数据展平后的总元素数)。
- nSubQ CUDA 实现:作者团队开发了名为 nSubQ 的 CUDA 内核,融合了 FFT 卷积路径,将理论复杂度转化为实际加速。
实验结果:纯 HyenaND 匹敌注意力,混合架构更胜一筹
论文在四个领域进行了广泛评测:
- 长上下文基因组学:DNA 序列建模,HyenaND 在准确率上媲美标准注意力。
- 计算机视觉:图像分类任务,纯 HyenaND 堆叠达到与强注意力基线(如 ViT)相当的结果。
- 医学影像:三维体积分割,HyenaND 原生处理 3D 数据的能力优于光栅化方案。
- PDE 建模:物理方程求解,HyenaND 展现了良好的全局建模能力。
混合配置:将 HyenaND 层与注意力层交错堆叠,效果超过纯注意力模型和基于循环的混合模型(如 Mamba-注意力混合)。这表明 HyenaND 不仅能单独使用,还能与 Transformer 互补,在效率与精度之间取得更优平衡。
行业意义:多维数据建模的“架构新选择”
HyenaND 的出现为处理高维、长序列数据提供了一种无需牺牲空间结构的高效方案。对于需要同时处理时间、空间、通道等多维信息的应用(如视频理解、气象模拟、科学计算),它可能成为 Transformer 的有力替代或补充。尤其是其 CUDA 优化实现 nSubQ 已开源,有望推动社区在医学影像、自动驾驶感知、数字孪生等领域的落地探索。
不过,HyenaND 目前仍处于 arXiv 预印本阶段,其在大规模多模态场景下的泛化能力、训练稳定性以及硬件适配性尚需进一步验证。但无论如何,这项研究为“后注意力时代”的架构设计提供了新的思路:与其强行将多维数据塞进一维管道,不如让模型学会在高维空间中“自然生长”。