SheepNav
新上线今天0 投票

从 Pass@K 与 Pass@1 的差距中学习:GapFT 让单次解码逼近搜索级准确率

核心发现

大语言模型(LLM)的强化学习训练正在从「可验证奖励」中获益,但一项新研究指出:现有后训练方法普遍忽视了一个关键区分——哪些问题模型一次就能答对,哪些问题需要多次采样才能「捞」出正确答案。

这篇来自 arXiv 的论文(编号 2609.35793)提出了 GapFT 方法:只针对「单样本失败、但 K 次采样内能解出」的问题进行微调,结果在 Llama-3.1-8B 上把 Pass@1 提升了 14.4 和 13.9 个百分点,并且用三分之一的训练数据就追平了在全量验证集上微调的效果。

问题背景:验证器能「捞答案」,但部署时往往只有一次机会

论文聚焦一个现实矛盾:

  • 训练侧:RLVR(可验证奖励强化学习)借助精确验证器,可以从多个采样中挑出通过的答案,支持测试时扩展(test-time scaling);
  • 部署侧:很多场景只允许单样本解码——每个问题生成一次回答,没有搜索、没有重采样。

作者提出的问题是:搜索暴露出来的行为,能否被「吸收」进模型本身?

现有做法通常把「已验证正确的回答」不加区分地用于后训练,但论文指出这会造成预算浪费——大量训练样本其实在重复模型已经掌握的行为。

GapFT 的做法

GapFT 的核心是按「来源检查点的单样本结果」筛选训练证据,专门在 Pass@K 与 Pass@1 的差距区间上微调,也就是:

模型单次采样失败、但在 K 次采样内被验证器判定通过的问题。

在实验设计上,论文严格控制了变量:训练样本数、处理的 token 数、优化器步数都保持一致,目标函数也不变,从而把提升归因于「样本选择」而非训练规模。

关键结果

  • 在 LogiQA 2.0 和 ReClor 两个逻辑推理数据集上,使用 Llama-3.1-8B:
    • GapFT 相比源模型 Pass@1 提升 14.4 / 13.9 分;
    • 在相同学习率下,优于预算对齐的均匀验证 RFT;
    • 用三分之一的数据追平在全量验证池上的微调效果。
  • 单次解码即可达到源模型经验证器筛选后的 Pass@4 准确率——这意味着原本需要 4 次采样加验证器才能拿到的效果,被压缩进了一次生成。
  • 随机对照实验表明,增益主要来自覆盖了不同的失败模式;分析还将可获得的增益与「可迁移的失败支撑集」联系起来。
  • 在 Qwen2.5-7B 上的三随机种子复现实验,在两个逻辑任务上仍保持对均匀 RFT 的正向增益。

为什么值得关注

对实际部署而言,测试时扩展(多采样 + 验证器)虽然有效,但推理成本高昂。GapFT 提供了一条更务实的路径:把搜索能力蒸馏进模型权重,让单次推理接近搜索级表现。

论文也坦承边界——增益与「可迁移的失败支撑」相关,意味着并非所有失败都能被这种训练方式补救。这为后续研究留下了明确的问题:哪些失败模式是可以通过后训练吸收的,哪些必须依赖外部工具或搜索?

延伸阅读

  1. Google 发布 Gemini 4 Argon,号称迄今最强模型,专攻网络安全与编程
  2. AI硬件设计新星Flow Engineering获5000万美元B轮融资,估值达7.5亿美元
  3. Google 发布 Gemini 4,宣称能力过强仅限“可信网络防御者”使用
查看原文