MESA:面向长时程智能体的任务自适应多结构证据选择框架
在人工智能领域,长时程智能体(Long-Horizon Agent)在执行复杂任务时,往往需要经历数百个交织的推理、行动和观察步骤。当用户提出一个查询时,答案可能依赖于历史轨迹中早已被淹没的关键证据。为了应对这一挑战,研究者们提出了多种外部记忆机制,将轨迹存储为结构化表示。然而,每种结构都只提供了不完整且侧重点不同的视角,如何高效地组合这些互补信息,成为提升智能体性能的关键问题。
现有系统通常采用两种策略:一是对每个查询都读取固定的一组结构,这会导致上下文膨胀并引入噪声;二是将每个查询路由到单一结构,这又无法整合来自不同结构的互补证据。这种非此即彼的做法,显然无法满足复杂任务的动态需求。
针对这一局限,来自多所机构的研究团队在最新论文中提出了一种名为 MESA(Multi-structure Evidence Selection framework) 的创新框架,旨在通过任务自适应的多结构证据选择,优化长时程智能体的记忆利用效率。
核心发现:最优配置并非“全都要”或“选一个”
研究团队首先在 AMA-Bench 基准上进行了受控分析,结果发现:对于不同查询和任务,最优的记忆配置通常既不是单一结构,也不是所有结构的简单并集,而是一个根据当前需求动态组合的多结构子集。这一发现直接挑战了现有方法的固定模式,为动态选择机制提供了理论依据。
MESA 框架:五个视角与强化学习
基于上述洞察,MESA 框架设计了五个互补的结构化视角来刻画每条轨迹,每个视角都捕捉了轨迹的不同侧面。在推理阶段,MESA 会从这五个结构中,针对当前查询,选择并融合一个特定的子集,以生成最终答案。
为了在缺乏细粒度监督的情况下学习这种选择策略,MESA 采用了端到端的答案级反馈,并引入了先验引导搜索和 UCB(Upper Confidence Bound)引导调度 的强化学习优化方法,从而在探索与利用之间取得平衡,有效提升学习效率。
显著成效:性能提升与成本降低
在 AMA-Bench 基准上的实验结果显示,MESA 相较于最强基线模型,在性能上提升了 8.5%,同时相较于使用全部结构的方案,证据 token 消耗减少了 41%。这表明 MESA 不仅能够更精准地定位关键证据,还能显著降低计算成本,提升推理效率。
这项研究为长时程智能体记忆管理提供了新的思路,其动态选择机制有望在复杂的多步推理任务中发挥重要作用,推动智能体在真实世界场景中的落地应用。