Plan-and-Patch:用扩散语言模型重构智能体规划,修复成功率翻倍、延迟降低近半
长程智能体的规划困境:计划赶不上变化
在长程智能体(long-horizon agent) 任务中,规划能力正变得愈发关键。一个成功的执行过程,往往需要在数十步乃至上百步中协调子目标、调用工具、处理中间结果。然而现实环境充满不确定性:规划阶段做出的假设可能被环境推翻,工具可能返回意料之外的结果,动作也可能直接失败。
这意味着,优秀的智能体不仅要会"制定计划",更要会"修改计划"。
问题在于,传统做法——把整个计划推倒重来——代价高昂且风险不小:原本正确的部分可能被无意改动,反而引入新的错误。
核心洞察:修复往往只涉及局部
来自 arXiv 的最新论文 《Plan-and-Patch: Diffusion Language Models for Agentic Planning》(arXiv:2610.10786,2026 年 10 月 7 日提交)提出了一个关键观察:
计划修订通常只影响其中一部分,而前后结构保持不变。
基于这一观察,作者提出 Plan-and-Patch 框架:与其重新生成整个计划,不如只修复受影响区域——在保留前缀与后缀的前提下,对选定的片段进行"补丁式"重写。
这一思路之所以可行,得益于扩散语言模型(dLLM) 的特性:它通过并行去掩码(parallel unmasking) 生成结构化、类程序式的计划,因此天然支持"填洞"式的局部修复,同时将周围步骤固定不变。
实验数据:修复成功率接近翻倍
研究团队对比了扩散模型 DreamReasoner-8B 与自回归模型 Qwen3-8B 作为规划器的表现,结果颇具说服力:
- 在 Natural Plan 基准上、未做任务特定训练的情况下,扩散模型的计划修复成功率达到 53.7%,几乎是自回归模型 27.0% 的两倍。
- 在 ALFWorld 与 TextCraft 两个智能体基准上完成任务特定训练后,两者在计划生成的成功率上表现相近。
- 但扩散模型将平均计划生成延迟降低了 39%–46%。
这组数据揭示了扩散规划器的双重优势:更快的生成速度,以及更有效的局部修复能力。
为什么值得关注
长期以来,自回归(AR)模型几乎是语言模型规划任务的默认选择——逐 token 顺序生成,天然契合文本。但顺序生成也意味着:一旦计划中途需要调整,模型很难"回头"只改一段,往往只能整段重写。
扩散语言模型的并行生成范式,恰好为"局部编辑"提供了结构性便利。Plan-and-Patch 把这种便利转化为智能体规划中的实际收益,指向一个更务实的方向:
让智能体的规划从"一次性生成"走向"可维护、可增量修复"。
对于需要长时间运行、频繁与环境交互的智能体系统而言,这种"打补丁"而非"重开一局"的能力,可能比单纯的生成质量更为重要。
论文由 Syamantak Kumar、Jiang Guo、Hassan Hamad 等九位作者合作完成,涉及人工智能、计算语言学与机器学习多个领域。