SheepNav
新上线今天0 投票

有限牛顿-舒尔茨迭代的Muon优化器:在非光滑非凸优化中的平滑优势

Muon优化器在大型语言模型预训练中表现出色,但其理论基础一直存在争议。 最新研究揭示,Muon使用的有限牛顿-舒尔茨(Newton-Schulz)迭代并非简单的近似误差,反而在非光滑非凸优化中带来了实质性的平滑优势。

背景:Muon与理论困境

Muon专为矩阵参数设计,通过在动量上执行数次牛顿-舒尔茨迭代来近似正交化,从而加速模型收敛。然而,现有理论分析要么假设使用精确的极分解(polar factor),要么将有限的迭代步数视为近似误差,导致理论保证弱于实际性能。这引发了一个核心问题:Muon实际运行的有限迭代是否可能损害收敛性?

核心发现:平滑性成为关键

来自研究者Mingyi Li和Taira Tsuchiya的最新论文(arXiv:2608.26288)给出了出人意料的答案:有限牛顿-舒尔茨迭代实际上是有益的。研究团队通过“在线到非凸转换”(online-to-nonconvex conversion)框架分析Muon,该框架将更新规则视为在线学习器,并将其遗憾界转换为平稳性保证。

关键洞察在于,有限的牛顿-舒尔茨迭代将不连续的极映射平滑为奇异值的Lipschitz映射,使得Muon可以视为具有平滑谱势的在线学习器。这种平滑性正是转换框架所需的:论文证明,仅需对数增长的迭代深度即可在非光滑非凸优化中收敛到稳定点,而使用精确极分解的Muon反而可能无法收敛。

理论意义与扩展

该研究的样本复杂度界与已知最佳的非光滑非凸优化保证相匹配,且在光滑非凸情况下达到最优(除问题相关因素外)。更重要的是,这一论证不仅限于牛顿-舒尔茨,还适用于具有相同平滑性质的一般谱映射,为优化器设计提供了新的理论视角。

实践启示

这项研究不仅填补了Muon理论基础的空缺,还提示我们:在优化算法中,近似计算有时不仅是工程妥协,更可能带来意外的理论优势。对于大模型训练中广泛使用的优化器,深入理解其迭代行为的平滑效应,有望指导更高效、更稳健的算法设计。

论文共37页,包含3个图,已提交至arXiv,并可能被机器学习顶级会议接收。对于优化理论和深度学习从业者而言,这无疑是一份值得细读的文献。

延伸阅读

  1. 超越能力基准:从生产事故元数据学习LLM云服务的操作指纹
  2. 无遗憾的隐私保护:差分隐私推理时对齐新方法
  3. 代数多重网格加速标签传播,实现高效半监督学习
查看原文