小模型撑不起智能体框架?arXiv 新研究揭示「微任务资格鸿沟」
一个被忽视的工程问题
当智能体(Agent)系统运行时,真正调用大模型做规划的往往只是少数环节,大量「微任务」散落在周围:自动批准 shell 命令、写入记忆、选择工具、对历史轮次排序。这些任务能不能交给一个开箱即用的小语言模型(SLM),既省钱又降延迟?
arXiv 上新提交的论文 《Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?》(作者 Jundong Hu、Shekar Ramachandran)给出了一个不太乐观的答案。
什么叫「资格」?先立规矩再测
研究者的做法是先定义标准,再让模型接受检验:
- 构建了 4 个微任务的基准,使用固定提示词和自动指标;
- 每个任务预设一个阈值 τ,锚定在一个「廉价的非 LLM 基线」之上;
- 采用 CI 感知的资格规则——只有当配置的置信区间下界越过 τ,才算通过。
这套规则的意义在于:不是「平均分看起来还行」就算过关,而是要有统计上的把握。
结果:16 个配置,0 个通过
研究团队扫描了 Qwen3 的 0.6B / 1.7B / 4B / 8B 四个规模(FP16、贪心解码、单一冻结提示词、不做任何微调),得到 4 任务 × 4 模型 = 16 个配置,全部未通过资格线。作者还通过检查原始输出与解析器行为做了人工核验。
进一步的 logprob 决策阈值诊断(T1/T3/T4 直接诊断,T2 用上下文长度/级联探针)把失败拆成了两类:
- 真正的能力缺陷;
- 可以通过调整解码阈值补救的失败。
最终归纳出 4 种失败状态(regimes)。这个区分很关键——它意味着「不达标」并不总是模型不行,有时只是决策门槛没调对。
量化不是万能药
一个自然的想法是:那量化到 4-bit 会不会好一点?研究测试了 RTN / GPTQ / AWQ 三种方案,结论是量化的损伤程度取决于模型规模,而且没有任何配置因此跨进资格线。作者在可重构硬标签任务(T1/T3)上做了认证,在 T2/T4 上做了诊断与窗口化稳健性验证。
一句话总结:这道鸿沟跟模型大小关系更大,跟精度关系更小。
结论稳不稳?做了多重稳健性检验
- 在 Llama-3.x 上复现:12/12 全部不合格;
- 对锚点选择做 τ 扫描,结论稳健;
- 对提示词措辞做检验:原始提示词加 3 个中性改写,112 个格子 0 个合格。
那 SLM 还有用吗?有,但要换个位置
论文给出的实践建议相当务实:把 SLM 放在满足 CI 阈值的基线之后,只在基线不达标的地方使用 SLM。
一个具体例子是:在 BM25 候选短名单之上跑一个 4B 重排序器,效果优于纯 BM25(+0.047,置信区间 [0.020, 0.073]),但这个重排序器本身并没有获得「资格认证」。
换句话说,SLM 的价值不在于替代基线,而在于兜底与补位。
对工程实践的启示
这篇预印本(15 页、8 图、14 表,投稿于 NeurIPS 2026 研讨会)传递的信号很清晰:
- 别默认「小模型够用」,先按统计标准测一遍;
- 失败要分类,能力问题和解码问题不能混为一谈;
- 量化省的是显存,不是资格;
- 架构上让 SLM 做「兜底者」而非「替代者」,是当前更稳妥的落点。
对于正在搭建 Agent 框架的团队来说,这套「先定阈值、再看置信区间」的评估思路,或许比结论本身更值得借鉴。