SheepNav
新上线9天前0 投票

球形流形上的新归一化方法:Sphere Retraction Normalizations

深度神经网络的训练稳定性很大程度上依赖于残差连接。近年来,一种名为GeoNorm的方法将残差连接重新诠释在黎曼流形上,通过正交化层输出与当前隐藏状态,并利用黎曼指数映射进行更新,使得隐藏状态始终保持在超球面上。然而,指数映射只是众多收缩映射中的一种。最新研究指出,在超球面上,整个收缩映射族可以归结为一个标量设计选择,并由此提出了一系列新的归一化方法,称为Sphere Retraction Normalizations

该研究由Jie Zhang等人完成,论文发表于arXiv。核心思想是:不同的收缩映射之间的区别仅在于更新幅度如何转换为旋转角度。基于此,研究者提出了Proj-SpheretNormCay-SpheretNorm,分别对应度量投影收缩和Cayley收缩,它们精确保持范数且仅需代数运算。进一步,这些方法统一在一个单参数族$p$-SpheretNorm中,其中$p=1$和$p=2$分别恢复上述两种方法,而恒等映射和GeoNorm则出现在参数极限处。

在nanoGPT上的实验表明,这三种方法均优于现有的轻量级深度连接方案,且最佳验证损失出现在有限$p$值,说明指数映射并非球形残差流的最佳选择,而是谱系的一端。这一发现为设计更高效的深度网络连接机制提供了新视角。

关键贡献

  • 将残差连接、GeoNorm和新的归一化方法统一在一个框架中。
  • 提出单参数族$p$-SpheretNorm,并证明其包含多种现有方法。
  • 实验验证了有限$p$值的优越性,挑战了指数映射的默认选择。

未来,这一方法有望在大型语言模型和其他深度架构中得到应用,进一步提升训练效率与性能。

延伸阅读

  1. Transformer残差流中的几何与行为分层:预测方向作为特权锚点
  2. 个性化评分建模:一种基于学习的多专家睡眠阶段标签生成框架
  3. 双时空归因:为循环图异常检测打造架构对齐的可解释性框架
查看原文