SheepNav
精选今天0 投票

对抗鲁棒性的溯因融合:无需领域知识,提升预训练感知模型性能

在AI领域,预训练模型在新环境中的部署常常面临性能下降的挑战,尤其是在分布偏移(distributional shift)的情况下。传统方法如多数投票(majority voting)虽然简单,但往往以牺牲召回率为代价换取精度,并且在面对协调性故障时显得脆弱。最近,一篇来自arXiv的论文提出了一种新颖的元认知方法,通过利用向量空间的几何特性,无需任何领域知识即可学习错误检测规则,从而在多个预训练Transformer感知模型的融合中实现鲁棒性提升。

背景与挑战

当多个预训练模型被部署到全新环境时,由于数据分布的变化,模型的准确性会下降。简单地将多个模型组合在一起并不能有效恢复性能,因为组合器如多数投票在权衡精确率和召回率时存在固有问题,且对系统性错误缺乏抵抗力。先前的研究尝试通过元认知方法学习逻辑规则来标记模型错误,但这些方法依赖于手工设计的领域知识线索,如物体大小先验或分割掩码,这些线索在真正新颖的场景中往往无法迁移。

创新方法:基于几何的标签向量池

该论文提出,元认知层可以不依赖任何领域知识,仅通过利用向量空间的几何特性来学习。具体而言,每个模型都可以构建一个标签向量池(Label Vector Pools,LVP),该池基于模型自身的训练嵌入。通过分析检测结果相对于训练确定原型的几何关系,可以推导出错误检测规则。实验表明,这种基于几何的规则在F1分数上与依赖领域知识的规则相差不超过0.002,达到了同等水平。

由于该方法仍然是神经符号的,这些几何规则可以与逻辑框架共存,并且当领域知识可用时,还可以作为补充。这种灵活性使得方法在保持鲁棒性的同时,能够适应不同场景的需求。

对抗鲁棒性实验

论文将多个不完美的ViT(Vision Transformer)检测器的融合问题建模为一致性溯因问题,并在测试时通过精确整数规划(IP)和多项式时间启发式算法求解。在包含15个天气偏移测试集和六个ViT检测器的航空图像基准上,该无领域知识的方法在干净数据上达到了与最强多数投票变体相当的性能(F1差异在0.005以内)。更重要的是,在协调性标签翻转攻击下,该方法保持了性能:当翻转率达到90%时,其平均F1为0.42,而多数投票(MV-Plurality)仅为0.35,相对提升了22%。此外,一旦翻转率超过0.4,该方法在每一个测试集上都取得了最高的F1分数。

结论与展望

这项工作展示了通过几何方法学习元认知层的潜力,无需依赖领域知识即可提升预训练模型的融合鲁棒性。这不仅为模型融合提供了新思路,也为在动态和对抗性环境中部署AI系统提供了更可靠的解决方案。未来,这一方法有望与更多领域知识结合,进一步拓展其应用范围。

延伸阅读

  1. MatrAIx:用83亿个数字人模拟真实世界,革新AI系统评估
  2. BrainBench:评估大语言模型在脑电信号综合理解上的能力
  3. FinPerMA:面向LLM智能体的理论驱动、事件锚定个性化记忆基准
查看原文