新上线今天0 投票
二值化评分正在「压平」奖励信号:LLM 评审该保留几档?
用大语言模型当评审、把打分结果直接转成「通过/不通过」来训练策略,是当前 RLHF 与可验证奖励之外最常见的做法之一。但一篇新论文指出,这种二值化操作会系统性地「压平」评分空间,让一类真实存在的质量变化在训练信号中彻底隐身。
问题出在哪
论文作者 Jacob Cole 把每个通过/不通过判定,建模为一条未公开评分尺度上的分数与某个阈值的比较。关键在于:只要对这条尺度做仿射拉伸(proportional stretch),所有分数会等比地靠近或远离阈值,却永远不会跨过阈值——于是没有任何一个判定会发生变化。
换句话说,策略完全可以对响应质量做这种整体缩放,而评审面板报告的结果一模一样。对训练而言,这意味着奖励信号对这类变化完全「失明」。
加一档就能修好
作者在联合高斯模型下证明:引入第三档评分相当于增加第二个阈值,从而消除这种仿射拉伸的歧义。
实验验证使用了 MATH 与 SciBench 的输出,评审为一个包含七项标准的 LLM judge。结果很直接:
- 构造出的 14 个逐标准拉伸,在二值化后全部不可见;
- 换成三档评分后,这些变化全部可见;
- 在 n=1,024 时,同时掌握两种总体分布的检验在 1.5 倍压力下功效至少达到 96.5%。
但三档也不是万能药
论文特别强调,保留档位只是堵上了一个盲点,判定本身仍然不够用。仍有两类变化无法与真实改进区分:
- 档位内的任意变化;
- 固定协方差、沿载荷方向对齐的均值漂移——作者称这正是「谄媚式提升」(sycophancy-shaped lift)的特征,而评审却会把它读成能力提升。
此外,论文使用的共享因子参考近似在 MATH 和 SciBench 上拟合良好,但在 HealthBench 上并不成立,这也划定了该方法的经验适用范围。
实践建议
作者给出的建议相当具体:
- 至少保留三档评分,例如让评审对每条标准回答「完全满足 / 部分满足 / 不满足」,并给予 {0, 0.5, 1} 的奖励;
- 对剩余方向上观察到的增益,进行外部验证——因为再细的评分尺度也无法消除这一方向的歧义。
论文共 14 页、3 张图、2 张表,属于预印本,尚未经过同行评审。对于正在用 LLM judge 构建奖励信号的团队来说,这项工作的价值在于:它把「二值化会损失什么」从直觉变成了可量化、可检验的结论。
