新上线今天0 投票
Adam 距离自然梯度下降究竟有多远?一篇新论文给出几何度量
一篇 arXiv 论文重新审视了 Adam 的"几何身份"
Adam 是深度学习中最常用的优化器,但它与**自然梯度下降(NGD)**之间到底有多接近,一直是理论上悬而未决的问题。arXiv 上最新的一篇论文《How Far is Adam from Natural Gradient Descent?》尝试用几何度量给出量化答案。
论文作者 Vihaan Paka-Hegde 把 Adam 的完整更新规则(包括动量项)建模为一种对角经验 Fisher 近似,并指出这种近似同时受到三重限制:对角截断、经验标签替换,以及时间滞后。换句话说,Adam 并不是在真正沿自然梯度方向走,而是在一个被简化、被延迟的近似版本上行走。
用 γ(Δθ) 度量"偏离程度"
为了量化这种偏离,作者采用了尺度不变的 γ(Δθ) 指标,在四种损失地形上测量 Adam 与真实 NGD 的几何偏差:
- 良态线性回归
- 病态线性回归
- 逻辑回归
- 一个非凸小型神经网络
结果显示,Adam 的几何轨迹高度依赖上下文:在良态场景下偏离很小,但在病态条件下显著上升,在神经网络中错位程度甚至达到约 10³ 量级。
偏离大,不代表效果差
一个耐人寻味的发现是:更高的几何漂移确实与初期优化变慢相关,但并不会损害最终的目标最小化——Adam 始终能收敛到较低的损失值。这暗示 Adam 的实际威力,可能并不来自"贴近自然梯度路径",而是来自结构性近似误差与动量平滑之间的某种平衡。
论文还比较了两种 Fisher 近似:改进版经验 Fisher(iEF)比标准经验 Fisher(EF)路径更稳定,后者经常出现震荡甚至发散。
这项研究为理解 Adam 为何在深度学习中如此有效提供了一个新的几何视角,也提示我们:一个优化器的成功,未必源于它精确逼近了某个理想方向。
