SheepNav
精选今天0 投票

DeReAct:解耦推理与行动,让 AI Agent 更可靠

当 Agent 既当运动员又当裁判

基于 ReAct 范式的 AI Agent 有一个长期存在的结构性问题:它依赖单一 LLM 策略同时完成三件事——提出行动、与环境交互、判断任务是否完成。这种耦合让「行动授权」和「完成控制」难以独立约束,错误会沿着轨迹一路传播,而 Agent 甚至可以给出缺乏依据的「任务已完成」声明并直接终止执行。

来自 arXiv 的一篇新论文 《DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents》(作者 Ajay Vohra、Tao Chen、Neeti Narayan、Caron Zhang)提出了一个模块化架构来解决这个问题。

把「门控」从主策略中拆出来

DeReAct 的核心思路是外置两个门控策略:

  • Critic(评审者):在行动真正执行之前,验证所提议的动作是否合理;
  • Context Manager(上下文管理器):重建一个有环境证据支撑的 State,并据此认证任务是否真的完成。

换句话说,Agent 的「大脑」(Brain)负责推理与提议,但「能不能做」和「算不算做完」这两件事被交给独立的模块来把关。

实验结果:弱模型受益最大

论文在 GAIA 和 SWE-bench Verified 两个基准上进行了评测,结论颇有意味:

  • 对 Qwen3-Coder-480B,Pass@1 提升 6.5–7.0 个百分点;
  • 对 Claude Sonnet 4.5,提升 4.2–5.2 个百分点;
  • 随着 Brain 模型能力增强,增益逐渐减弱——用 Claude Opus 4.5 时,Pass@1 与 ReAct 基本持平。

这说明外部门控的价值,恰恰体现在主策略本身不够强、特定类型失败足够普遍的场景中。

一个值得注意的权衡

论文的轨迹与消融分析还揭示了一个细节:在 Claude Opus 4.5 上,DeReAct 虽然没能把 Pass@1 拉高,但产出的轨迹证据更完整、更满足约束条件。这意味着完成控制可能用「更早终止」换来了「更强的落地依据(grounding)」。

对正在搭建生产级 Agent 的团队而言,这篇工作的启示是:与其一味堆砌更强的基座模型,不如先想清楚——哪些决策应该被独立校验。当失败模式集中在「乱执行」和「假完成」上时,一个外置的 Critic 和 Context Manager,可能比换一个更大的模型更划算。

论文编号 arXiv:2610.02351,属于 cs.AI 与 cs.LG 分类。

延伸阅读

  1. AI智能体为何难以落地?企业知识断层成最大瓶颈
  2. OpenAI 详解欧盟文本溯源规则:水印技术 textGrain 分阶段落地
  3. 预测分析迈向自主决策时代:AI 智能体如何重塑企业未来
查看原文