LLM 也能自动标注归因图:让电路追踪不再依赖人工
在 AI 可解释性研究的前沿,电路追踪(circuit tracing)一直被视为揭示大语言模型(LLM)内部计算机制的有力工具。然而,这项技术有一个长期被诟病的瓶颈:研究者需要手动将大量独立的特征或 MLP 神经元分组为“超节点”(supernodes),过程既费时又费力。近期一篇来自 arXiv 的论文提出了一种简单却高效的自动化方案——直接让大语言模型阅读特征描述,并自动完成分组工作。
自动化标注的新思路
这项研究由 Ameen Patel、Max Zhang 和 Nathan Hu 共同完成,发表于 ICML 2026 机械可解释性研讨会。核心方法并不复杂:将每个特征或神经元的自然语言描述直接输入给一个 LLM,由它来判断哪些描述指向相同的语义概念,从而生成超节点。这相当于把人类注释者的归纳能力“移植”给模型,省去了繁琐的人工步骤。
效果媲美人工,甚至能发现“隐藏”的中间步骤
为了验证自动化标注的质量,研究团队使用了自动化的可解释性指标,结果显示:LLM 生成的超节点与人类注释者生成的超节点在可解释性上不相上下。更令人惊喜的是,在一个“两跳首都”任务(比如“法国首都的首都是哪里?”)中,该流程在 100 个提示中的 97 个成功恢复了对应中间跳(即“巴黎”)的超节点,证明其不仅能分组,还能捕捉到关键的推理步骤。
从封闭任务走向开放探索
论文还展示了一个开放探索场景下的概念验证:团队利用该流程自动标注了 1000 个来自维基百科提示补全的归因图,并借助一个 LLM 裁判来筛选值得人工审查的“有趣”图。这为大规模、低成本的机制可解释性研究打开了新的大门。
意义与展望
这项工作的价值在于,它证明了即使是简单的自动化,也能产出有意义的归因图注释,从而推动全自动电路追踪研究的发展。对于 AI 社区而言,这意味着我们有望以更低的成本、更快的速度理解大模型的内部行为,为安全性和可靠性提供更有力的保障。当然,目前该方法仍依赖于特征描述的质量,且尚未在更复杂的任务上得到全面验证,但无疑为可解释性研究指明了一个值得探索的新方向。
