当推理时 PRM 剪枝片段嫁接完全失效:来自三个推理语言模型的实证
一个看似自然的设计,为何在推理时完全失灵
并行思维链(parallel chain-of-thought)常被用来提升大模型的推理覆盖度,但它有一个众所周知的副作用:多样性坍缩——多条并行轨迹往往会收敛到相似的错误或相似的正确路径,浪费算力。
一个直觉上很自然的补救方案是:当**过程奖励模型(PRM)**判定某条链走偏并剪枝时,把这条链中 PRM 打分较高的前缀提取出来,原样「嫁接」到另一条仍在解码的兄弟链上,作为上下文示范。这被称为 PRM-Pruned Fragment Grafting(PPFG),是跨轨迹、步骤级知识迁移中成本最低的实现方式。
但一篇新论文给出了一个耐人寻味的结果:在特定配置下,PPFG 与独立的并行 CoT 基线在统计上无法区分。
实验怎么做的
研究者在 Qwen2.5-7B-Instruct 上,配合 Math-Shepherd 作为 PRM,在完整的 MATH500 数据集(n=500,三个随机种子)上测试 PPFG 的两种变体:停滞目标(stagnation-targeting)与随机目标(random-targeting)。
结果:在每一个测量维度上,两种变体都与独立的并行 CoT 基线没有显著差异。
失效的原因:嫁接打错了靶子
作者对 322 次停滞规则触发的注入事件做了四桶分类,发现:
- 只有 14% 真正瞄准了「正在挣扎」的链;
- 其余注入落在了已经成功的链、接近完成的链,或处于 PRM 平台期的链上——这些状态下的「救援式嫁接」根本无法改变结局。
更关键的是,没有任何复合门控(compound-gate)方案能同时做到「精准触发」和「足够密度」。而一个随机对照组在 2.4 倍触发率下也表现出同样的持平效果,说明这种惰性并非某个启发式规则特有的问题。
结论的稳健性与边界
该发现具备相当的稳健性:
- 在三个基础语言模型、六个基准、第二个 PRM以及兼容性门控扫描中都能复现;
- 通过双单侧检验(two-one-sided tests),在全部十二个 Qwen/LLaMA 单元上把「持平」提升为正向等价;
- 逐事件抽查发现,被注入的链确实以 2.75 倍于匹配步骤的速率被剪枝,但存活兄弟链的反事实分析显示,这种局部效应没有转化为群体层面的补偿收益;
- 事后预言机(hindsight oracle)给出的每问题收益上界仅为 +0.13 个百分点。
意义何在
这项工作的价值不止于否定一个具体机制。作者贡献了一个等价性检验模板,用于确立推理时机制的「零结果」,并且把每一条结论都严格限定在其测试的操作点上。
在推理时干预(inference-time intervention)研究火热的当下,这提醒我们:一个机制在某个配置下有效,不等于它在更便宜的配置下也有效;而「嫁接高 PRM 前缀」这种看似优雅的直觉,可能只是在给已经跑完的链做无用功。对于正在构建 PRM 剪枝、并行采样或步骤级迁移系统的团队而言,这是一个值得对照的负面基准。