SheepNav
精选今天0 投票

基准测试的推理并不总能组合:AI评估中的可投射性

在人工智能评估中,一项基准测试结果要转化为有影响力的结论,往往需要经过多个推理步骤。研究者需要将结果泛化到更多场景、将其解释为能力的证据、外推到新任务、迁移到其他系统或环境,并结合关于人类审查和下游后果的假设。基于效度的评估方法要求每一步推理都有证据支持。但最新研究指出,即使每一步都有充分证据,整个推理链条也可能并不成立。

这篇题为《When benchmark inferences do not compose: Projectibility in AI evaluation》的论文由Brett Reynolds撰写,于2026年7月提交至arXiv。论文的核心观点是:相邻推理步骤的合理性并不能自动保证组合后的整体推理链条的合理性。这被称为“非组合原则”。具体而言,当从一项研究的目标到下一项研究的来源之间出现系统、人群、结果或条件的变化时,或者当共享数据或模型血缘使得看似独立的证据实际上相互依赖时,组合推理就可能失效。

论文引入了“可投射性”(projectibility)概念,用于判断从观察到未观察案例的有界扩展是否合理。作者借鉴了古德曼(Goodman)关于“竞争性扩展”的问题,并利用基于论证的效度理论来检验这些扩展。通过一个法律研究案例,论文展示了基准测试证据和部署研究虽然各自有效,但可能彼此平行,无法直接组合。此外,重新分析和模拟表明,聚合稳定性可能掩盖后续投射所需的区分,从而导致错误的推理。

这项研究为AI评估提供了一种“可投射性审计”方法,用于诊断从基准测试到实际应用之间的推理链条中不合理的连接。这对于当前AI评估领域具有重要意义,因为许多声称的AI能力往往建立在多重推理之上,而这些推理的链条可能并不牢固。

论文的代码和实证配套已公开,供研究者进一步探索。这一工作提醒我们,在评估AI系统时,不仅需要关注每一步推理的合理性,还需审视整个推理链条的连贯性。

延伸阅读

  1. 深入探究推理性能之源:RL与SFT微调模型在数学问题求解中的表征质量对比
  2. 更多欺骗:混合动机LLM多智能体系统中的目标错位
  3. ClinLens:面向纵向多模态临床数据科学的长期编码智能体评测基准
查看原文