SheepNav
精选今天0 投票

Pistis 技术报告:27B/9B 多模态大模型登场,IDRL 后训练范式与自动 Harness 优化

一句话概括

一篇来自 arXiv 的技术报告(arXiv:2609.28554)公开了 Pistis 模型家族:基于 Qwen3.6 和 Qwen3.5 构建的 27B 与 9B 两档多模态大语言模型,核心创新是一套把「蒸馏」和「强化学习」交织进同一训练循环的后训练框架 IDRL,以及一个不更新模型参数就能提升 Agent 表现的系统级方法 PAH。

后训练的新思路:IDRL

Pistis 的训练路径分两步。第一步是常规但关键的大规模多模态监督微调(SFT),用来打底。第二步则是论文的主角——Interleaved Distillation and Reinforcement Learning(IDRL)。

IDRL 的做法值得注意:它没有把 on-policy 蒸馏和强化学习拆成两个独立阶段,也没有把它们塞进一个静态的联合损失里,而是让两个目标在同一个训练循环中交替进行。作者称这种设计带来三个好处:

  • 更有效的知识迁移:蒸馏负责把外部能力「灌」进来;
  • 更高的优化稳定性:交替而非同时优化,减少了目标之间的相互干扰;
  • 更精确的信用分配(credit assignment):这一点对长程(long-horizon)智能体轨迹尤其重要。

换句话说,IDRL 试图缓解后训练中常见的能力此消彼长问题——推理能力上去了,工具调用或指令跟随却掉下来。

两个变体:Thinking 与 Agentic

在两个参数规模上,Pistis 都产出两个专用变体:

  • Pistis-Thinking:面向深度多模态推理;
  • Pistis-Agentic:额外引入智能体轨迹数据,支持长程规划、迭代推理和工具调用。

报告特别指出,Pistis-Agentic 在多模态搜索场景中表现尤为突出。两个规模都优于各自的基座模型。

PAH:不动参数也能变强

除了模型层面的优化,团队还提出 Pistis-Auto-Harnessing(PAH),一种系统级方法:通过迭代优化自动改进 Agent 的推理 harness(即模型外部的调用编排与提示框架)。实验显示,PAH 能在不更新模型参数、也不增加交互预算的前提下提升模型表现。

值得关注的信号

这篇报告折射出当前大模型后训练的两个趋势:一是蒸馏与 RL 的边界正在模糊,混合范式成为主流探索方向;二是「模型之外」的优化空间——harness、上下文编排、工具调用流程——正被当作独立且高性价比的增益来源。

需要说明的是,本文基于 arXiv 摘要信息整理,论文的完整实验数据、基准对比与消融结果尚未在摘要中展开,具体性能提升幅度仍有待正文验证。

延伸阅读

  1. Proaction 借助 Codex 实现销售额增长 60%,每月节省 75+ 小时
  2. 五角大楼砸3000万美元打造AI测谎仪,专家为何称其「最糟糕的组合」?
  3. 五角大楼拟投3000万美元打造AI测谎仪,专家称方向错误
查看原文