新上线昨天0 投票
合成数据要多少才够?新研究:覆盖度才是激活探针的关键,难度不是
关键结论
训练一个用于监控大语言模型的激活探针(activation probe),到底需要多少合成对话?一项新研究给出了反直觉的答案:决定样本需求量的不是概念的难度,而是覆盖度。
这项题为《Coverage, Not Difficulty, Sets How Much Synthetic Data an Activation Probe Needs》的论文,系统追踪了三种监控概念的学习曲线:
- 高风险情境(high-stakes)
- 对他人有害的回复(harmful)
- 不遵循用户指令的回复(instruction)
实验覆盖 10 到 590 个合成样本、14 个留出评估分布、4 种探针模型,并变化了生成器 LLM 和提示词的详细程度。
不同概念,需求差距巨大
在 Gemma-3-27B-IT 上,高风险和有害概念的探针从 80 个样本起就接近平台期,误差仅在百分之几以内。但指令遵循探针需要数倍于前者的样本量才能达到类似水平。这一排序在三个更小的探针模型以及真实样本(来自 dev 集)上同样成立。
覆盖度,而非难度
研究者将“概念需要的深度”定义为拟合曲线的半增益规模(half-gain size)——即获得一半增益所需的样本数。
统计分析显示:
- 概念和分布解释了半增益规模方差的 42–45%
- 生成器、探针模型和提示词细节加起来不到 10%
更关键的是,每个评估分布对应一种“类型”,其自身类型样本的中位半增益规模仅为 7–11 个——在三种概念下几乎一致。
真正造成差异的是:一种类型的样本向其他类型迁移的能力。
- 高风险情境下,迁移几乎完全
- 有害概念次之
- 指令遵循最差
这解释了为何指令探针需要更多样本:没有一种类型能覆盖另一种。
对实践的启示
此前的工作建议将生成预算花在广度(更多种类的数据)而非深度(每种数据更多样本)上。这项研究进一步指出:广度的回报因概念而异。
- 对于指令遵循,多种类型是必要的,因为彼此不覆盖
- 对于高风险情境,多种类型几乎是冗余的,一种就能覆盖其余
研究者同时发布了评估套件、开发集和生成集,为后续探针训练提供了可复现的基准。
