SheepNav
精选昨天0 投票

Plan-and-Patch:用扩散语言模型重构智能体规划,修复成功率翻倍、延迟降低近半

长程智能体的规划困境:计划赶不上变化

在长程智能体(long-horizon agent) 任务中,规划能力正变得愈发关键。一个成功的执行过程,往往需要在数十步乃至上百步中协调子目标、调用工具、处理中间结果。然而现实环境充满不确定性:规划阶段做出的假设可能被环境推翻,工具可能返回意料之外的结果,动作也可能直接失败。

这意味着,优秀的智能体不仅要会"制定计划",更要会"修改计划"。

问题在于,传统做法——把整个计划推倒重来——代价高昂且风险不小:原本正确的部分可能被无意改动,反而引入新的错误。

核心洞察:修复往往只涉及局部

来自 arXiv 的最新论文 《Plan-and-Patch: Diffusion Language Models for Agentic Planning》(arXiv:2610.10786,2026 年 10 月 7 日提交)提出了一个关键观察:

计划修订通常只影响其中一部分,而前后结构保持不变。

基于这一观察,作者提出 Plan-and-Patch 框架:与其重新生成整个计划,不如只修复受影响区域——在保留前缀与后缀的前提下,对选定的片段进行"补丁式"重写。

这一思路之所以可行,得益于扩散语言模型(dLLM) 的特性:它通过并行去掩码(parallel unmasking) 生成结构化、类程序式的计划,因此天然支持"填洞"式的局部修复,同时将周围步骤固定不变。

实验数据:修复成功率接近翻倍

研究团队对比了扩散模型 DreamReasoner-8B 与自回归模型 Qwen3-8B 作为规划器的表现,结果颇具说服力:

  • 在 Natural Plan 基准上、未做任务特定训练的情况下,扩散模型的计划修复成功率达到 53.7%,几乎是自回归模型 27.0% 的两倍。
  • 在 ALFWorld 与 TextCraft 两个智能体基准上完成任务特定训练后,两者在计划生成的成功率上表现相近。
  • 但扩散模型将平均计划生成延迟降低了 39%–46%。

这组数据揭示了扩散规划器的双重优势:更快的生成速度,以及更有效的局部修复能力。

为什么值得关注

长期以来,自回归(AR)模型几乎是语言模型规划任务的默认选择——逐 token 顺序生成,天然契合文本。但顺序生成也意味着:一旦计划中途需要调整,模型很难"回头"只改一段,往往只能整段重写。

扩散语言模型的并行生成范式,恰好为"局部编辑"提供了结构性便利。Plan-and-Patch 把这种便利转化为智能体规划中的实际收益,指向一个更务实的方向:

让智能体的规划从"一次性生成"走向"可维护、可增量修复"。

对于需要长时间运行、频繁与环境交互的智能体系统而言,这种"打补丁"而非"重开一局"的能力,可能比单纯的生成质量更为重要。

论文由 Syamantak Kumar、Jiang Guo、Hassan Hamad 等九位作者合作完成,涉及人工智能、计算语言学与机器学习多个领域。

延伸阅读

  1. AI 拒绝机制的双刃剑:安全的屏障还是潜在的灾难?
  2. 让 AI 智能体在你的屏幕上画箭头、方框和文字:bigarrow 登陆 Hacker News
  3. OpenAI解雇三名安全研究员,当事人发公开信否认指控并警告寒蝉效应
查看原文