精选今天0 投票
LLM提方案,执行器做决定:一种自我验证的智能体工具,将长期任务中的承诺漂移与约束漂移分离
在长期运行的AI智能体中,如何验证其行为可靠性一直是个难题。一篇来自arXiv的最新论文提出了一种新颖的架构,通过将决策与执行分离,实现了结构性的自我验证。
该论文由Mohsen Arjmandi撰写,描述了一种智能体工具,其核心思想是:一个确定性的执行器(Executive)拥有所有信念,而语言模型(LLM)只能提交类型化的提案。只有当行动前预注册的预测与代码观察到的结果匹配时,声明才会被接受。这种设计使得验证不再是事后追溯,而是内建于系统结构之中。
关键特性
该工具具有两个关键特性:
- 自失效机制:当每个组织的写入错误、渲染大小或盐渍金丝雀回显等阈值被突破时,每次运行都会自动失效。论文报告称,前八次架构运行中有四次被判定无效,且每次都定位到真实缺陷。
- 影子参考系统:一个渲染不可见的影子参考会编译完整系统在每个消融单元中本应承诺的计划,从而在移除被测机制的情况下也能定义漂移指标。
实验结果
研究者利用该工具研究了一个长期智能体普遍存在的失败模式:承诺漂移。实验结果显示,消融承诺机制会使目标放弃率从0.00跃升至1.00,而约束错误保持0.00(每个单元三个种子,每次运行最多394个参考节拍,所有运行均通过有效性门控)。相比之下,约束通道在修复被消融时不会以逐拍漂移的形式重新出现,因为约束由代码拥有,失败类别被结构性吸收,其残余仅在上游表现为假设形成的崩溃。
坦诚的局限
值得注意的是,论文坦诚地报告了任务效能为零:在ARC-AGI-3基准上的52次门控运行中,没有一次完成关卡,这一结果被预注册为结构性缺陷。尽管如此,论文的贡献在于提出了一种验证方法论,并使得漂移分解变得可测量。
这一研究为AI智能体的可靠性验证提供了新思路,尤其在长期任务中,如何确保智能体不偏离原始目标,是未来AI系统设计中至关重要的一环。