新上线今天0 投票
从 Pass@K 与 Pass@1 的差距中学习:GapFT 让单次解码逼近搜索级准确率
核心发现
大语言模型(LLM)的强化学习训练正在从「可验证奖励」中获益,但一项新研究指出:现有后训练方法普遍忽视了一个关键区分——哪些问题模型一次就能答对,哪些问题需要多次采样才能「捞」出正确答案。
这篇来自 arXiv 的论文(编号 2609.35793)提出了 GapFT 方法:只针对「单样本失败、但 K 次采样内能解出」的问题进行微调,结果在 Llama-3.1-8B 上把 Pass@1 提升了 14.4 和 13.9 个百分点,并且用三分之一的训练数据就追平了在全量验证集上微调的效果。
问题背景:验证器能「捞答案」,但部署时往往只有一次机会
论文聚焦一个现实矛盾:
- 训练侧:RLVR(可验证奖励强化学习)借助精确验证器,可以从多个采样中挑出通过的答案,支持测试时扩展(test-time scaling);
- 部署侧:很多场景只允许单样本解码——每个问题生成一次回答,没有搜索、没有重采样。
作者提出的问题是:搜索暴露出来的行为,能否被「吸收」进模型本身?
现有做法通常把「已验证正确的回答」不加区分地用于后训练,但论文指出这会造成预算浪费——大量训练样本其实在重复模型已经掌握的行为。
GapFT 的做法
GapFT 的核心是按「来源检查点的单样本结果」筛选训练证据,专门在 Pass@K 与 Pass@1 的差距区间上微调,也就是:
模型单次采样失败、但在 K 次采样内被验证器判定通过的问题。
在实验设计上,论文严格控制了变量:训练样本数、处理的 token 数、优化器步数都保持一致,目标函数也不变,从而把提升归因于「样本选择」而非训练规模。
关键结果
- 在 LogiQA 2.0 和 ReClor 两个逻辑推理数据集上,使用 Llama-3.1-8B:
- GapFT 相比源模型 Pass@1 提升 14.4 / 13.9 分;
- 在相同学习率下,优于预算对齐的均匀验证 RFT;
- 用三分之一的数据追平在全量验证池上的微调效果。
- 单次解码即可达到源模型经验证器筛选后的 Pass@4 准确率——这意味着原本需要 4 次采样加验证器才能拿到的效果,被压缩进了一次生成。
- 随机对照实验表明,增益主要来自覆盖了不同的失败模式;分析还将可获得的增益与「可迁移的失败支撑集」联系起来。
- 在 Qwen2.5-7B 上的三随机种子复现实验,在两个逻辑任务上仍保持对均匀 RFT 的正向增益。
为什么值得关注
对实际部署而言,测试时扩展(多采样 + 验证器)虽然有效,但推理成本高昂。GapFT 提供了一条更务实的路径:把搜索能力蒸馏进模型权重,让单次推理接近搜索级表现。
论文也坦承边界——增益与「可迁移的失败支撑」相关,意味着并非所有失败都能被这种训练方式补救。这为后续研究留下了明确的问题:哪些失败模式是可以通过后训练吸收的,哪些必须依赖外部工具或搜索?
