新上线今天0 投票
Active SAE特征平面是否承载更多和乐?Gemma模型中的预注册反转发现
研究背景与核心问题
在可解释性研究中,稀疏自编码器(SAE)被广泛用于分解神经网络内部表示。一个关键假设是:SAE特征平面(由单个特征及其对应的解码器方向定义)可能承载更多与语义相关的几何结构,例如“和乐”(holonomy)——一种衡量平行输运后方向变化的量。本文通过预注册实验,在 Gemma 2 2B 模型上检验了一个具体预测:活跃SAE特征平面(即当前token激活的特征对应的平面)是否比混合特征平面(包含激活与非激活特征)具有更大的和乐值。
实验设计与关键结果
研究者在 第12层到第13层残差流的最终token读出口 测量和乐:通过限制雅可比传输规则携带局部标架沿小环移动,并将旋转量除以环面积进行归一化。实验设计、显著性阈值、分析和判定规则均在查看数据前冻结。
结果出人意料——预测被反向证伪:活跃特征平面的和乐值低于匹配的混合特征控制组,调整后的对数对比度为 -0.29439(95%置信区间 [-0.43989, -0.14889])。这一反转并非由特征幅度差异简单解释:在匹配幅度条件下,由于共同支持缺失,随机、混合和活跃三类平面之间的排序无法定义。
诊断分析与未解之谜
冻结后的诊断实验表明:在小验证子集上,和乐值遵循面积律;配对回归显示匹配中心位移有界;同时,传输畸变(transport distortion)被识别为一个可能的机制或混杂因素。作者强调,该结果是一个狭窄、可审计的操作性反转,而非“意义抑制和乐”的因果论断。
目前,导致反转的潜在原因仍然开放,包括:
- 激活强度几何
- 特征参与程度
- 字典几何
- 匹配中心位移
- 激活流形邻近性
- 传输剪切
行业意义与启示
这项研究对AI可解释性领域具有重要启示:
- 预注册方法的价值:通过预先冻结分析计划,避免了p-hacking和事后解释,增强了结果可信度。
- SAE假设的挑战:广泛使用的SAE特征平面可能并不像直觉认为的那样承载更多语义几何结构,甚至可能相反。这提示研究者需要更精细地审视SAE的几何属性。
- 开放科学实践:论文附带了完整的实验记录和代码(存档于Zenodo),便于复现和后续研究。
该工作提醒我们,在解释神经网络内部机制时,直观假设需要经受严格检验。未来研究需要进一步探索和乐反转的根源,以及如何利用这一发现改进SAE的可解释性。