超越路由权重:通过贡献对比实现混合专家奖励模型的忠实响应级解释
奖励模型是从人类反馈中学习的关键,但理解其预测依据一直是个难题。近期,稀疏混合专家(MoE)奖励模型通过将提示路由到专门专家,并利用高路由权重的示例来刻画专家行为,试图提升可解释性。然而,路由权重仅能揭示专家"接收"了哪些提示,却无法说明它如何"评判"响应,因此只能提供部分行为解释。为此,研究者提出了**贡献对比(CoCo)**方法,一种响应级解释技术,通过选择具有最大贡献差异的"选中-拒绝"响应对来忠实刻画专家角色,同时捕捉路由和偏好行为。自动与人工评估显示,CoCo相比基于路由、基于分数和基于稀疏自编码器的替代方法,能产生更连贯、更忠实且更专门化的解释,同时保持有竞争力的奖励建模精度。据作者所知,这是首个针对MoE奖励模型解释方法的系统性研究。
该研究由Yifan Wang、Jinyi Mu、Mayank Jobanputra、Yu Wang、Soyoung Oh、Isabel Valera和Vera Demberg共同完成,论文以arXiv:2608.06400发布。
背景:MoE奖励模型的解释挑战
奖励模型在强化学习与人类反馈(RLHF)中扮演核心角色,但它们的内部决策过程往往如同"黑箱"。稀疏MoE架构通过将输入路由到不同的专家网络,旨在提升效率与专业性,但同时也引入了新的解释维度:我们不仅要理解每个专家擅长什么,还要知道它们如何影响最终的奖励分数。传统方法依赖路由权重,即通过统计哪些提示被分配给哪个专家,来推断专家的功能。但这种方法存在明显局限——它只能告诉我们专家"看到了什么",却无法揭示专家"如何评价"。
CoCo方法:响应级解释的新思路
CoCo的核心创新在于,它不再仅仅关注路由分配,而是将注意力放在响应对的贡献差异上。具体来说,CoCo会寻找那些让某个专家产生最大贡献差异的"选中-拒绝"响应对,即该专家对选中响应的贡献远高于对拒绝响应的贡献。这样的响应对最能体现该专家的偏好特征,从而更准确地刻画其在奖励评估中的角色。
这种方法同时考虑了路由行为和偏好行为,弥补了路由权重解释的不足。实验表明,CoCo生成的解释在连贯性、忠实性和专门化程度上都优于现有的替代方案,包括基于路由权重、基于得分和基于稀疏自编码器的方法。同时,使用CoCo解释的模型在奖励建模精度上并未妥协,保持了与原始模型相当的性能。
意义与展望
这项研究首次系统地探讨了MoE奖励模型的解释方法,为理解这类复杂模型提供了新的工具。CoCo不仅有助于研究人员验证模型是否按照预期工作,还能帮助识别潜在偏见或错误,从而改进模型设计。未来,该框架可能扩展到其他类型的MoE模型,甚至用于解释多模态或更大型的模型。
尽管CoCo展示了令人鼓舞的结果,但作者也指出,解释的忠实性仍依赖于响应对的选取质量,且不同任务可能需要调整对比策略。这一领域仍处于早期阶段,更多探索值得期待。