SheepNav
新上线今天0 投票

球形流形上的新归一化方法:Sphere Retraction Normalizations

深度神经网络的训练稳定性很大程度上依赖于残差连接。近年来,一种名为GeoNorm的方法将残差连接重新诠释在黎曼流形上,通过正交化层输出与当前隐藏状态,并利用黎曼指数映射进行更新,使得隐藏状态始终保持在超球面上。然而,指数映射只是众多收缩映射中的一种。最新研究指出,在超球面上,整个收缩映射族可以归结为一个标量设计选择,并由此提出了一系列新的归一化方法,称为Sphere Retraction Normalizations

该研究由Jie Zhang等人完成,论文发表于arXiv。核心思想是:不同的收缩映射之间的区别仅在于更新幅度如何转换为旋转角度。基于此,研究者提出了Proj-SpheretNormCay-SpheretNorm,分别对应度量投影收缩和Cayley收缩,它们精确保持范数且仅需代数运算。进一步,这些方法统一在一个单参数族$p$-SpheretNorm中,其中$p=1$和$p=2$分别恢复上述两种方法,而恒等映射和GeoNorm则出现在参数极限处。

在nanoGPT上的实验表明,这三种方法均优于现有的轻量级深度连接方案,且最佳验证损失出现在有限$p$值,说明指数映射并非球形残差流的最佳选择,而是谱系的一端。这一发现为设计更高效的深度网络连接机制提供了新视角。

关键贡献

  • 将残差连接、GeoNorm和新的归一化方法统一在一个框架中。
  • 提出单参数族$p$-SpheretNorm,并证明其包含多种现有方法。
  • 实验验证了有限$p$值的优越性,挑战了指数映射的默认选择。

未来,这一方法有望在大型语言模型和其他深度架构中得到应用,进一步提升训练效率与性能。

延伸阅读

  1. Shopify:AI搜索带来更多流量与销售,而非取代谷歌
  2. Hark 预览浏览器代理 Hark Handoff,宣称更快更便宜
  3. 谷歌宣布9月4日彻底关闭手机上的Assistant,Gemini全面接管语音助手
查看原文