SheepNav
精选今天0 投票

超越玩笑:多角度推理检测与解释模因中的有害幽默

互联网模因(meme)因其视觉线索、文本内容与文化语境的复杂交织,使得幽默、讽刺与有害意图共存时尤其难以解读。这种复杂性催生了对可解释模因理解系统的需求——系统不仅需要准确分类,还需提供可靠且结构化的推理,以支持人类可理解性。然而,现有多模态分类器要么忽视这些相互依赖关系,要么仅提供有限的解释能力。

针对这一挑战,研究团队提出了 MAR-12 框架,一种利用视觉语言模型(VLM)进行模因检测与理解的新方法。该框架首先从幽默与仇恨理论中衍生出的 12 个结构化视角 对每个模因进行解读,涵盖意图、情感、社会语境等多个维度。随后,框架引入 角色感知的软门控注意力机制,自适应地学习每个视角对最终预测的贡献权重。最后,基于原型分类器做出预测,并综合各视角的推理结果与注意力权重生成透明且符合语境的解释。

性能表现

PrideMMMemotion 两个基准数据集上,MAR-12 在幽默检测任务中达到 80.3% 的准确率,在仇恨检测任务中达到 75.9% 的准确率,均优于现有最先进方法。此外,人类评估与 GPT-4 评估均确认 MAR-12 能生成连贯且具有说服力的解释,尤其针对那些幽默与有害信号共存的模因。

行业意义

当前,AI 内容审核面临“一刀切”困境:过度过滤会误伤正常表达,宽松处理又可能纵容仇恨言论。MAR-12 的多角度推理与可解释输出,为平衡内容安全与表达自由提供了新思路。其结构化视角不仅提升了检测精度,更让审核决策有据可循,有助于平台向用户和监管机构透明化其内容管理逻辑。

该研究已被 AAAI-ICWSM 2027 接收,标志着可解释 AI 在社交媒体内容理解领域的重要进展。未来,类似框架或可扩展至更广泛的模因类型与文化语境,推动更负责任的内容审核系统落地。

延伸阅读

  1. 中国AI模型让特朗普的AI世界内部分裂
  2. 今日下载:AI招聘偏见,以及天气数据破坏风险
  3. 长时程模型时代的安全与对齐:OpenAI 从内部部署中学到的教训
查看原文