SheepNav
精选今天0 投票

LLM长程状态追踪能力新测试:通过196次工具调用执行MD5哈希

大型语言模型(LLM)在长程任务(long-horizon tasks)中的表现一直缺乏清晰的评估基准。原因很简单:当每一步都依赖前一步的结果时,即使单步准确率看似很高,错误也会级联放大,端到端的失败率随序列长度急剧上升。现有的智能体基准测试虽然报告了端到端的成功率,但往往将状态追踪困难与指令理解混淆,缺乏隔离变量,且容易被模型幻觉出的最终答案所干扰,因此无法解释长程任务失败的根本原因。

为了干净地测试LLM在多次工具调用中携带精确中间状态的能力,研究者设计了一个巧妙的任务:让模型逐步计算MD5哈希值。MD5是一种密码学哈希函数,其计算过程包含64轮操作,共需要196次依赖工具调用,模型需要在每次调用间在上下文中携带四个32位字(a, b, c, d)作为状态。由于MD5是确定性算法,研究者从零实现了RFC 1321规范,可以将每次调用与真实轨迹对齐,并逐位检查最终摘要,从而将任何失败都归因于纯粹的“记账”错误,而非指令误解。

实验结果表明,gpt-oss-120b模型(一种混合专家模型,每个token仅激活约55亿参数)在温度设为0、使用简短固定提示的情况下,能够成功携带全部状态完成196次调用,并在大多数完成的运行中返回正确的MD5摘要。更极端的设置是,研究者将每个原始工具替换为另一个LLM,使一个“驱动”模型和一个“工作”模型在没有精确算术外部工具的情况下,从零开始计算完整哈希。

研究发现,有两个关键因素决定成功与否,且都不涉及调整模型权重:

  • 保留模型自身推理:在每一轮中,将模型自己的推理过程保留在上下文中,有助于维持状态一致性。
  • 投票机制:对启用思考能力的工作模型进行多次运行并投票,以消除其模运算中的偶发错误。

通过将残差失败按来源分类(状态携带、算术错误、服务问题),研究者得以精确定位LLM在长程依赖任务中的薄弱环节。这项工作为评估和改进LLM的长期状态追踪能力提供了新的视角和方法。

延伸阅读

  1. UI-Venus-2:跨越移动、网页与桌面的通用GUI智能体
  2. SCAFFOLD:大规模计算机科学论文图表理解数据集,助力视觉语言模型
  3. OpenAgentFlow:为异构AI智能体舰队构建全系统安全边界
查看原文