新上线今天0 投票
球形流形上的新归一化方法:Sphere Retraction Normalizations
深度神经网络的训练稳定性很大程度上依赖于残差连接。近年来,一种名为GeoNorm的方法将残差连接重新诠释在黎曼流形上,通过正交化层输出与当前隐藏状态,并利用黎曼指数映射进行更新,使得隐藏状态始终保持在超球面上。然而,指数映射只是众多收缩映射中的一种。最新研究指出,在超球面上,整个收缩映射族可以归结为一个标量设计选择,并由此提出了一系列新的归一化方法,称为Sphere Retraction Normalizations。
该研究由Jie Zhang等人完成,论文发表于arXiv。核心思想是:不同的收缩映射之间的区别仅在于更新幅度如何转换为旋转角度。基于此,研究者提出了Proj-SpheretNorm和Cay-SpheretNorm,分别对应度量投影收缩和Cayley收缩,它们精确保持范数且仅需代数运算。进一步,这些方法统一在一个单参数族$p$-SpheretNorm中,其中$p=1$和$p=2$分别恢复上述两种方法,而恒等映射和GeoNorm则出现在参数极限处。
在nanoGPT上的实验表明,这三种方法均优于现有的轻量级深度连接方案,且最佳验证损失出现在有限$p$值,说明指数映射并非球形残差流的最佳选择,而是谱系的一端。这一发现为设计更高效的深度网络连接机制提供了新视角。
关键贡献:
- 将残差连接、GeoNorm和新的归一化方法统一在一个框架中。
- 提出单参数族$p$-SpheretNorm,并证明其包含多种现有方法。
- 实验验证了有限$p$值的优越性,挑战了指数映射的默认选择。
未来,这一方法有望在大型语言模型和其他深度架构中得到应用,进一步提升训练效率与性能。
