SheepNav
精选今天0 投票

先比较再行动:让长程工具调用智能体学会评估每一步的价值

问题出在「奖励太晚」

当大语言模型处理复杂任务时,往往需要连续调用一长串外部工具:查资料、改文件、发请求、再验证结果。每一次调用都会改变任务状态,并决定后续还能做什么。

这种长程工具调用(long-horizon tool use)场景下,训练信号却非常稀疏——通常只有最终结果给出一个「成功/失败」的奖励。问题是,一条几十步的交互轨迹里,到底是哪一步做对了、哪一步走偏了?最终奖励几乎无法回答,这种现象被称为弱信用分配(weak credit assignment)。

针对这一点,arXiv 上最新的一篇论文《Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents》提出了一个更符合直觉的思路:智能体应该在真正执行某个工具调用之前,先估计它的长期价值。 该论文已被 NeurIPS 2026 接收为 Poster。

为什么要「比较」而不是「打分」

如果只是给每一步打一个绝对分数,标准很难统一,而且需要大量人工或 LLM 逐步标注,成本高昂。

论文的核心洞察是:真正需要的不是孤立评分,而是在相同上下文下,对不同候选工具调用做比较——哪个更可能通向最终成功。

但这里有个现实障碍:日志轨迹里只记录了实际被执行的那一个调用,那些「没被选中的选项」天然缺失,监督信号无从获取。

CITA 的三路信号

为此,作者提出了 Comparative Inference for Tool-use Agents(CITA),训练一个比较推理模型(Comparative Inference Model, CIM)。它的监督来自三类配对信号:

  • 真实观测到的工具行为:来自实际轨迹的调用记录;
  • 贝叶斯工具图模拟器:提供可扩展的合成监督,弥补数据缺口;
  • 基于 LLM 的语义比较判断:补充语义层面的合理性评估。

训练完成后,CIM 能够针对当前上下文,估计某个候选工具调用支持最终任务成功的概率。

实验结果

论文在三个工具调用基准、多种骨干 LLM 上进行了验证,CITA 在 Tool F1 与任务成功率两项指标上均取得一致提升。

额外分析显示,CIM 确实学到了较为准确的步骤级价值估计,能够对不同的工具选择做出有区分度的比较判断。

一点观察

这项工作触及了智能体训练的一个关键瓶颈:长程决策中的细粒度监督。它没有依赖昂贵的人工逐步标注,而是用「比较」这一相对信号绕开了绝对评分的难题。对于正在构建工具调用型 Agent 的团队来说,这种「先评估、再执行」的范式值得关注——它可能成为提升 Agent 可靠性的一个实用方向。

延伸阅读

  1. AI智能体为何难以落地?企业知识断层成最大瓶颈
  2. OpenAI 详解欧盟文本溯源规则:水印技术 textGrain 分阶段落地
  3. 预测分析迈向自主决策时代:AI 智能体如何重塑企业未来
查看原文