SheepNav
精选今天0 投票

快模型,慢证据:LLM Agent 决策模型的一次自我审计式配对评估

当「快思考」被塞进 Agent 流水线

LLM Agent 每完成一个任务,背后往往要做出大量细碎而类型化的判断:调用哪个模型、选择哪个工具、检索到的文本是否相关、输入是否携带提示注入。如果每次判断都交给一次完整的 LLM 调用,成本和延迟会迅速累积。System-1 决策模型的思路正是针对这一点——用单次前向传播直接输出类别概率,试图以更低的代价替代这些小型决策。

但「快」是否等于「准」?arXiv 上的一篇新论文给出了一个相当谨慎的答案。

配对评估:11 个决策点、两组模型

作者 Jiawei Li 对两个 System-1 模型进行了配对评估:开源权重模型 Laya 与托管模型 Jev。测试集覆盖 11 个 Agent 决策点,来自 18 个公开来源,包含 7,283 个基础用例以及 6,640 个鲁棒性变体。评估强调字节级一致的输入、配对检验,以及跨硬件、跨天的可复现性检查。

结果并不均衡:

  • Jev 在 11 个决策点中的 9 个上显著更准,领先幅度为 +10.8 到 +46.0 个百分点。
  • 在零样本模型路由上,两个模型都没有超过随机水平。
  • 在 RAG 相关性门控上,两者打成平手。
  • Laya 的脆弱性尤其明显:当选项顺序反转时,它会改变 30% 的答案;在候选数量多或彼此相似时表现急剧下降——50 个最近邻工具时准确率为 31%,而 Jev 在存在唯一正确工具的条目上达到 98%。

这些数字指向一个现实:System-1 模型在「选项少、区分度高」的场景里可能够用,但一旦候选空间变大或语义相近,单次前向传播的概率输出就开始失稳。

更值得注意的:作者审计了自己的流水线

这篇论文的另一半价值在于自我审计。作者主动披露了分析过程中的错误与设计混杂因素,并指出它们曾扭曲过部署结论:

  • 遗漏的预筛选成本:原本报告的 23.9% 节省,实际只有 4.3%。
  • 门控准确率被当成端到端质量:58% 对 98%,两者含义完全不同。
  • 样本内阈值:目标 5%,但留出集上的漏检最高达到 17%。
  • 通道效应:注入误报上的通道差异,在使用通道原生内容后消失。

另外两个疑似混杂因素经检验后未改变结论。作者同时公开了全部用例、原始输出与分析代码。

这意味着什么

对正在搭建 Agent harness 的团队来说,这篇论文传递了两个信号。第一,System-1 决策模型不是万能替代品:模型路由这类需要全局判断的任务,零样本表现仍不可靠;工具选择在候选变多时也需要更谨慎的验证。第二,评估本身需要被评估:一个看似可观的成本节省,可能因为漏算预筛选开销而大幅缩水。

在 Agent 系统越来越依赖「小模型做小决策」的趋势下,这篇论文的价值或许不在于给出某个模型的好坏定论,而在于提醒:快模型给出的答案,需要慢证据来验证。

延伸阅读

  1. AI智能体为何难以落地?企业知识断层成最大瓶颈
  2. OpenAI 详解欧盟文本溯源规则:水印技术 textGrain 分阶段落地
  3. 预测分析迈向自主决策时代:AI 智能体如何重塑企业未来
查看原文