新上线今天0 投票
ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式坍缩
ReNFT:从内部修复扩散模型的模式坍缩
生成式扩散模型在奖励后训练中常常面临一个棘手问题:模型为了追求高奖励,会过度集中概率质量于少数几个奖励偏好的模式,导致生成结果的多样性大幅下降,即所谓的“模式坍缩”。这种坍缩不仅削弱了模型对同一提示词下不同可能性的探索,还可能抹去预训练阶段习得的丰富视觉概念。
现有缓解坍缩的方法多依赖外部信号或接口,比如调整奖励函数、引入感知目标、修改参考正则化或文本编码器,但这些方法都无法在不牺牲已获奖励的前提下,修复一个已经坍缩的适配器。
针对这一困境,来自腾讯等机构的研究者提出了一种名为 ReNFT 的新方法,其核心思想是:坍缩并非信息删除,而是概率质量的重新分配。在线后训练主要是在预训练已有的能力之间重新分配概率质量,而非学习全新的视觉内容。因此,坍缩是可以从生成器内部逆转的。
ReNFT 的修复流程分为三步:
- 无条件探测:首先优先选择“反枢纽”提示词,这些提示词最容易暴露模型与提示无关的偏见。
- 混合路由生成:通过两条由策略主导的混合路径,从同一提示词和初始噪声生成匹配的反事实提议。一条路径冻结基础模型方向,用于探索被压制的替代方案;另一条路径则暴露后训练模型的无条件倾向。
- 联合成对NFT更新:利用奖励排序和自适应翻转守卫,为每个提议分配“推”或“拉”的角色,并通过联合成对的 NFT(Neural Fine-Tuning)更新实现修复。
实验结果显示,在 PickScore 和 GenEval 基准上,ReNFT 在保留 NFT 奖励的 98.9% 和 99.0% 的同时,将 DreamSim-Div 多样性指标分别提升了 58.8% 和 55.0%。这表明 ReNFT 能够有效恢复多样性,且几乎不损失奖励,为外部干预手段提供了一种互补的替代方案。
这项研究为扩散模型的奖励后训练提供了一种新的内部修复思路,尤其适用于需要兼顾奖励与多样性的应用场景。论文细节可参阅 arXiv:2609.00061。