SheepNav
精选今天0 投票

多写程序还是多跑几遍?LLM Harness 中覆盖率与特化能力的真相

一个被忽视的评测盲区

当人们谈论提升大模型推理能力时,自动生成 LLM harness(任务外壳程序) 常被视为一条通过"任务特化"来提升表现的捷径。但一篇新论文指出,这条路可能比想象中更模糊。

问题出在评测逻辑上:一个程序跑出正确答案,究竟是因为它针对任务做了有效特化,还是仅仅因为多执行了几遍、碰巧覆盖到了正确答案?如果后者成立,那么所谓"特化收益"就只是一种统计幻觉。

实验设计:把三种增益拆开

来自 arXiv 的论文 《More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses》(编号 2609.35873)提出了一个受控评测框架,试图把三类容易混淆的收益分离开来:

  • 答案覆盖率:程序是否最终能触达正确答案;
  • 可重复的任务优势:这种优势是否在多次执行中稳定出现;
  • 预执行选择带来的增益:能否在运行前就挑出更优程序。

研究团队在 386 个 MATH-500 任务上展开对比,使用 8 个生成式 harness 加一个基线,并额外设置了 9 个字节完全相同的基线副本,每个成员执行三次。

关键发现:稳定性才是分水岭

结果颇具冲击力。

相同程序本身就能带来 2.16 个百分点的重复平均 oracle 余量——也就是说,即便程序完全一样,多跑几遍也能"刷"出额外覆盖率。这说明单纯看覆盖率提升,无法证明特化有效。

生成式程序确实表现出更强的可重复得分模式,但这些模式主要暴露的是持续性弱点:

  • 在 100 个任务上,相对基线的劣势在三次重复中始终存在;
  • 而持续性的胜利只出现在 1 个任务上,且对答案抽取方式高度敏感。

更值得注意的是,冻结选择器带来的增益为 0.00 个百分点。当两组程序各自执行到 27 次 harness 执行时,oracle 覆盖率都达到了 98.70%。换句话说,多写程序和多跑几遍,在覆盖率上殊途同归。

为什么这很重要

论文的结论相当克制但尖锐:覆盖率和可重复性本身,不足以支撑"有用特化"的主张。在三次重复的条件下,稳定的互补性仍未得到解决。

作者进一步用 BIRD 轨迹定位失败原因,发现瓶颈集中在 机制实现、激活和输出有效性 三个环节——这提示问题可能不在"程序数量不够",而在"程序质量与调用方式"。

一个值得关注的评测标准

论文因此提出了一套针对 harness 多样性的评测标准:任务优势应当

  1. 跨执行持续存在;
  2. 能指导可用决策;
  3. 在匹配推理预算下,优于额外执行固定程序。

这实际上是在追问一个更本质的问题:我们到底是在为"更聪明的程序"买单,还是在为"更多的尝试次数"买单?在推理成本日益敏感的当下,这个区分将直接影响 harness 生成方向的资源投入。该论文目前正投稿于 ICLR 2027。

延伸阅读

  1. OpenAI首席研究官回应“黑客事件”:我们不会自毁长城
  2. OpenAI 首席研究官回应智能体越狱事件:我们不会自毁长城
  3. OpenAI 披露并瓦解一起协同模型蒸馏攻击行动
查看原文