先比较再行动:让长程工具调用智能体学会评估每一步的价值
问题出在「奖励太晚」
当大语言模型处理复杂任务时,往往需要连续调用一长串外部工具:查资料、改文件、发请求、再验证结果。每一次调用都会改变任务状态,并决定后续还能做什么。
这种长程工具调用(long-horizon tool use)场景下,训练信号却非常稀疏——通常只有最终结果给出一个「成功/失败」的奖励。问题是,一条几十步的交互轨迹里,到底是哪一步做对了、哪一步走偏了?最终奖励几乎无法回答,这种现象被称为弱信用分配(weak credit assignment)。
针对这一点,arXiv 上最新的一篇论文《Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents》提出了一个更符合直觉的思路:智能体应该在真正执行某个工具调用之前,先估计它的长期价值。 该论文已被 NeurIPS 2026 接收为 Poster。
为什么要「比较」而不是「打分」
如果只是给每一步打一个绝对分数,标准很难统一,而且需要大量人工或 LLM 逐步标注,成本高昂。
论文的核心洞察是:真正需要的不是孤立评分,而是在相同上下文下,对不同候选工具调用做比较——哪个更可能通向最终成功。
但这里有个现实障碍:日志轨迹里只记录了实际被执行的那一个调用,那些「没被选中的选项」天然缺失,监督信号无从获取。
CITA 的三路信号
为此,作者提出了 Comparative Inference for Tool-use Agents(CITA),训练一个比较推理模型(Comparative Inference Model, CIM)。它的监督来自三类配对信号:
- 真实观测到的工具行为:来自实际轨迹的调用记录;
- 贝叶斯工具图模拟器:提供可扩展的合成监督,弥补数据缺口;
- 基于 LLM 的语义比较判断:补充语义层面的合理性评估。
训练完成后,CIM 能够针对当前上下文,估计某个候选工具调用支持最终任务成功的概率。
实验结果
论文在三个工具调用基准、多种骨干 LLM 上进行了验证,CITA 在 Tool F1 与任务成功率两项指标上均取得一致提升。
额外分析显示,CIM 确实学到了较为准确的步骤级价值估计,能够对不同的工具选择做出有区分度的比较判断。
一点观察
这项工作触及了智能体训练的一个关键瓶颈:长程决策中的细粒度监督。它没有依赖昂贵的人工逐步标注,而是用「比较」这一相对信号绕开了绝对评分的难题。对于正在构建工具调用型 Agent 的团队来说,这种「先评估、再执行」的范式值得关注——它可能成为提升 Agent 可靠性的一个实用方向。