SheepNav
新上线今天0 投票

从行与列尺度场看 Transformer 权重的介观结构

导语

Transformer 权重的整体统计量(如均值、方差)会掩盖一个关键问题:权重的数值大小究竟是如何在功能通道之间分布的?而单个权重又太多,无法逐一比较。一篇新论文提出了介于两者之间的介观视角——行与列尺度场。

什么是「行与列尺度场」

论文将权重矩阵分解为三个部分:

  • 全局尺度:一个标量,表示整体大小
  • 行与列尺度场:以中位数为中心的 log-RMS 轮廓,刻画每个通道的相对幅度
  • 平衡核心:去掉尺度后的完整结构

这三者可以精确重建原始权重矩阵。换句话说,尺度场提供了一组坐标,把「整体幅度统计」和「通道组织」连接起来。

实验发现了什么

作者在 Pythia 公开检查点上进行了分析,覆盖四个不同规模,并补充了三类初始化家族的受控实验。主要发现包括:

  1. 平衡后核心幅度轮廓相似:不同规模、不同初始化下,进行尺度平衡后,核心矩阵的幅度轮廓表现出相似性。
  2. 混合桥模型可预测形状偏移:作者预先固定模型形式,再拟合系数,成功在留出运行和数据分支上预测了「池化形状」随场宽的偏离。
  3. 尺度场保留额外结构:
    • 共享功能通道的投影之间,索引场会相互对齐;
    • query/key 的轮廓跟随重新分配的 RoPE 频率,而非固定的矩阵坐标。
  4. 训练轨迹呈现阶段性:早期形成尺度场,随后不同组件出现展宽或收缩。
  5. AdamW 二阶矩也有类似组织:将其扩展到 log 空间的行列因子后,同样观察到相关的功能组织。

编辑实验:区分两种平衡

论文最后对冻结检查点进行编辑,区分了:

  • 互易尺度平衡:保持前向计算不变
  • 相对通道增益:将增益「拉平」会提高分布内损失,同时保持矩阵范数和平衡核心不变

这说明通道增益本身承载了模型性能所需的信息。

意义与局限

这项工作为理解训练后权重的内部结构提供了新的可追踪坐标。它可能帮助研究者更精细地诊断模型、比较不同训练策略,甚至指导压缩与编辑。不过,目前分析集中在 Pythia 系列和受控初始化上,能否推广到更大模型、更多架构,仍需进一步验证。

论文共 37 页、14 张图、5 张表,代码与数据已公开。

延伸阅读

  1. Google 发布 Gemini 4 Argon,号称迄今最强模型,专攻网络安全与编程
  2. AI硬件设计新星Flow Engineering获5000万美元B轮融资,估值达7.5亿美元
  3. Google 发布 Gemini 4,宣称能力过强仅限“可信网络防御者”使用
查看原文