SheepNav
新上线今天0 投票

二值化评分正在「压平」奖励信号:LLM 评审该保留几档?

用大语言模型当评审、把打分结果直接转成「通过/不通过」来训练策略,是当前 RLHF 与可验证奖励之外最常见的做法之一。但一篇新论文指出,这种二值化操作会系统性地「压平」评分空间,让一类真实存在的质量变化在训练信号中彻底隐身。

问题出在哪

论文作者 Jacob Cole 把每个通过/不通过判定,建模为一条未公开评分尺度上的分数与某个阈值的比较。关键在于:只要对这条尺度做仿射拉伸(proportional stretch),所有分数会等比地靠近或远离阈值,却永远不会跨过阈值——于是没有任何一个判定会发生变化。

换句话说,策略完全可以对响应质量做这种整体缩放,而评审面板报告的结果一模一样。对训练而言,这意味着奖励信号对这类变化完全「失明」。

加一档就能修好

作者在联合高斯模型下证明:引入第三档评分相当于增加第二个阈值,从而消除这种仿射拉伸的歧义。

实验验证使用了 MATH 与 SciBench 的输出,评审为一个包含七项标准的 LLM judge。结果很直接:

  • 构造出的 14 个逐标准拉伸,在二值化后全部不可见;
  • 换成三档评分后,这些变化全部可见;
  • 在 n=1,024 时,同时掌握两种总体分布的检验在 1.5 倍压力下功效至少达到 96.5%。

但三档也不是万能药

论文特别强调,保留档位只是堵上了一个盲点,判定本身仍然不够用。仍有两类变化无法与真实改进区分:

  1. 档位内的任意变化;
  2. 固定协方差、沿载荷方向对齐的均值漂移——作者称这正是「谄媚式提升」(sycophancy-shaped lift)的特征,而评审却会把它读成能力提升。

此外,论文使用的共享因子参考近似在 MATH 和 SciBench 上拟合良好,但在 HealthBench 上并不成立,这也划定了该方法的经验适用范围。

实践建议

作者给出的建议相当具体:

  • 至少保留三档评分,例如让评审对每条标准回答「完全满足 / 部分满足 / 不满足」,并给予 {0, 0.5, 1} 的奖励;
  • 对剩余方向上观察到的增益,进行外部验证——因为再细的评分尺度也无法消除这一方向的歧义。

论文共 14 页、3 张图、2 张表,属于预印本,尚未经过同行评审。对于正在用 LLM judge 构建奖励信号的团队来说,这项工作的价值在于:它把「二值化会损失什么」从直觉变成了可量化、可检验的结论。

延伸阅读

  1. Google 发布 Gemini 4 Argon,号称迄今最强模型,专攻网络安全与编程
  2. AI硬件设计新星Flow Engineering获5000万美元B轮融资,估值达7.5亿美元
  3. Google 发布 Gemini 4,宣称能力过强仅限“可信网络防御者”使用
查看原文