新上线今天0 投票
C²MOE:面向不完整多模态情绪学习的一致性与互补性引导的专家混合框架
多模态对话情绪识别(MERC)近年来取得了显著进展,但其性能高度依赖完整的多模态输入。然而,现实场景中,由于传输错误或用户行为,模态数据经常缺失,导致模型性能严重下降。现有方法通过跨模态一致性学习来增强鲁棒性,却往往忽略了模态间的互补性,造成有偏的重建。针对这一局限,来自湖南师范大学等机构的研究者提出了 C²MOE(Consistency and Complementarity-guided Mixture of Experts)框架,旨在统一表示学习与缺失模态插补,并在信息论框架下进行优化。该研究已提交至 arXiv(编号:2608.04013)。
核心思路:分解一致性与互补性
C²MOE 将多模态知识分解为一致性和互补性两个组成部分,并通过交互感知的专家模块进行建模。一致性通过最大化跨模态可预测性来捕捉,而互补性则通过最大化模态间的条件熵来保留。这种分解方式使得模型能够更全面地理解模态间的复杂关系。
双分支预测与动态加权融合
基于上述分解,C²MOE 引入了双分支预测机制以实现缺失模态下的稳健插补。一致性分支通过最小化不确定性,使插补特征与联合分布对齐;互补性分支则通过熵最大化,利用模态独有的线索。最后,一个可学习的重加权模块动态地为每个专家的输出分配重要性分数,从而实现自适应融合。
实验验证与行业意义
在多个 MERC 基准上的大量实验表明,C²MOE 在各种缺失模态设置下均优于现有最先进方法,验证了其鲁棒性和泛化能力。这一工作不仅解决了多模态学习中一个关键的实际问题,也为情感计算和人机交互领域提供了新的思路。随着多模态 AI 在医疗、教育、客服等领域的广泛应用,处理不完整数据的能力将成为模型落地的关键。C²MOE 的提出,为这一挑战提供了有效的解决方案,并可能推动后续研究在更复杂的不完整场景中探索。