Pistis 技术报告:27B/9B 多模态大模型登场,IDRL 后训练范式与自动 Harness 优化
一句话概括
一篇来自 arXiv 的技术报告(arXiv:2609.28554)公开了 Pistis 模型家族:基于 Qwen3.6 和 Qwen3.5 构建的 27B 与 9B 两档多模态大语言模型,核心创新是一套把「蒸馏」和「强化学习」交织进同一训练循环的后训练框架 IDRL,以及一个不更新模型参数就能提升 Agent 表现的系统级方法 PAH。
后训练的新思路:IDRL
Pistis 的训练路径分两步。第一步是常规但关键的大规模多模态监督微调(SFT),用来打底。第二步则是论文的主角——Interleaved Distillation and Reinforcement Learning(IDRL)。
IDRL 的做法值得注意:它没有把 on-policy 蒸馏和强化学习拆成两个独立阶段,也没有把它们塞进一个静态的联合损失里,而是让两个目标在同一个训练循环中交替进行。作者称这种设计带来三个好处:
- 更有效的知识迁移:蒸馏负责把外部能力「灌」进来;
- 更高的优化稳定性:交替而非同时优化,减少了目标之间的相互干扰;
- 更精确的信用分配(credit assignment):这一点对长程(long-horizon)智能体轨迹尤其重要。
换句话说,IDRL 试图缓解后训练中常见的能力此消彼长问题——推理能力上去了,工具调用或指令跟随却掉下来。
两个变体:Thinking 与 Agentic
在两个参数规模上,Pistis 都产出两个专用变体:
- Pistis-Thinking:面向深度多模态推理;
- Pistis-Agentic:额外引入智能体轨迹数据,支持长程规划、迭代推理和工具调用。
报告特别指出,Pistis-Agentic 在多模态搜索场景中表现尤为突出。两个规模都优于各自的基座模型。
PAH:不动参数也能变强
除了模型层面的优化,团队还提出 Pistis-Auto-Harnessing(PAH),一种系统级方法:通过迭代优化自动改进 Agent 的推理 harness(即模型外部的调用编排与提示框架)。实验显示,PAH 能在不更新模型参数、也不增加交互预算的前提下提升模型表现。
值得关注的信号
这篇报告折射出当前大模型后训练的两个趋势:一是蒸馏与 RL 的边界正在模糊,混合范式成为主流探索方向;二是「模型之外」的优化空间——harness、上下文编排、工具调用流程——正被当作独立且高性价比的增益来源。
需要说明的是,本文基于 arXiv 摘要信息整理,论文的完整实验数据、基准对比与消融结果尚未在摘要中展开,具体性能提升幅度仍有待正文验证。