精选今天0 投票
DEEPO:双熵增强策略优化,破解多模态大模型幻觉难题
幻觉为何越训越顽固?
多模态大语言模型(MLLMs)在强化学习(RL)的加持下,推理能力一路飙升,但幻觉问题却并未同步改善——有时甚至越训越顽固。一篇新论文《DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs》将这一矛盾追溯到「奖励 → 参数更新」这条修正链上的两个薄弱环节。
两个被忽视的断点
- Rollout 层:高语义熵的难题让优势信号归零。 对于语义熵高、模型本身就没把握的查询,采样出的回答组往往集体出错。在 GRPO 这类组相对优势方法中,一组样本全错意味着组内差异为零,优势值随之塌缩为 0——而这里恰恰是幻觉风险最高的地方。模型在最该被纠正的位置,反而收不到任何有效梯度。
- 优化层:自信但错误的 token 成了「梯度隐形人」。 当策略分布越来越尖锐(即模型非常自信)时,类别策略的期望得分梯度范数会趋近于零。结果是:最需要被修正的自信错误,得到的更新反而最弱。
DEEPO 的双阶段解法
针对这两个断点,作者提出 DEEPO(Dual-Entropy Enhanced Policy Optimization),将信号方差正则化与梯度预条件结合:
- 语义熵触发的专家前缀(semantic-entropy-triggered expert prefixes):当查询不确定性高时,注入有依据的续写内容,提供直接监督,从而恢复优势方差,让高难样本重新产生有效的学习信号。
- 优势符号感知的 Renyi 预条件(advantage-sign-aware Renyi preconditioning):对抗 logit 层面的饱和现象,使修正能够触达「操作置信区间」内的自信错误。
效果如何?
论文报告称,两个分支单独使用均优于 GRPO;二者结合在 VideoMMMU——评测套件中最复杂的长程任务——上表现出统计显著的提升:+4.0,95% 置信区间 [1.1, 6.9],在其他任务上则呈叠加效应。DEEPO 在降低幻觉的同时保持了准确率与训练稳定性。
为什么值得关注
这项工作的价值不只在于一个新算法,更在于它把「幻觉」从笼统的模型缺陷,拆解成了可定位、可干预的优化机制问题。对于正在用 RL 后训练多模态模型的研究者与工程团队而言,DEEPO 提示了一个关键方向:修正链上的信号衰减,可能比模型容量本身更值得优先处理。
论文编号 arXiv:2609.28570,提交于 2026 年 9 月 23 日,作者包括 Yingxuan Zhuang、Miao Pan、Wangjie Gan 等九人。