有限牛顿-舒尔茨迭代的Muon优化器:在非光滑非凸优化中的平滑优势
Muon优化器在大型语言模型预训练中表现出色,但其理论基础一直存在争议。 最新研究揭示,Muon使用的有限牛顿-舒尔茨(Newton-Schulz)迭代并非简单的近似误差,反而在非光滑非凸优化中带来了实质性的平滑优势。
背景:Muon与理论困境
Muon专为矩阵参数设计,通过在动量上执行数次牛顿-舒尔茨迭代来近似正交化,从而加速模型收敛。然而,现有理论分析要么假设使用精确的极分解(polar factor),要么将有限的迭代步数视为近似误差,导致理论保证弱于实际性能。这引发了一个核心问题:Muon实际运行的有限迭代是否可能损害收敛性?
核心发现:平滑性成为关键
来自研究者Mingyi Li和Taira Tsuchiya的最新论文(arXiv:2608.26288)给出了出人意料的答案:有限牛顿-舒尔茨迭代实际上是有益的。研究团队通过“在线到非凸转换”(online-to-nonconvex conversion)框架分析Muon,该框架将更新规则视为在线学习器,并将其遗憾界转换为平稳性保证。
关键洞察在于,有限的牛顿-舒尔茨迭代将不连续的极映射平滑为奇异值的Lipschitz映射,使得Muon可以视为具有平滑谱势的在线学习器。这种平滑性正是转换框架所需的:论文证明,仅需对数增长的迭代深度即可在非光滑非凸优化中收敛到稳定点,而使用精确极分解的Muon反而可能无法收敛。
理论意义与扩展
该研究的样本复杂度界与已知最佳的非光滑非凸优化保证相匹配,且在光滑非凸情况下达到最优(除问题相关因素外)。更重要的是,这一论证不仅限于牛顿-舒尔茨,还适用于具有相同平滑性质的一般谱映射,为优化器设计提供了新的理论视角。
实践启示
这项研究不仅填补了Muon理论基础的空缺,还提示我们:在优化算法中,近似计算有时不仅是工程妥协,更可能带来意外的理论优势。对于大模型训练中广泛使用的优化器,深入理解其迭代行为的平滑效应,有望指导更高效、更稳健的算法设计。
论文共37页,包含3个图,已提交至arXiv,并可能被机器学习顶级会议接收。对于优化理论和深度学习从业者而言,这无疑是一份值得细读的文献。