SheepNav
新上线今天0 投票

qZACH-ViT:量化感知的内在解释模型,通过递归归因稳定优化实现高效医学图像分类

引言

在医学影像分析领域,紧凑型分类器往往需要在效率可解释性之间做出权衡。传统方法通常将两者分开处理,导致模型要么轻量但缺乏透明度,要么可解释却计算开销大。近期,一篇发表于 arXiv 的论文提出了 qZACH-ViT,一种量化感知的视觉 Transformer 变体,旨在同时实现高效部署与内在可解释性。

核心方法

qZACH-ViT 基于 ZACH-ViT 骨干网络进行扩展,摒弃了传统的 CLS token 和位置编码,转而通过递归方式生成内在的块级类别证据。其关键创新在于引入了 递归归因稳定优化(RASO):该方法通过范数匹配分类梯度与归因梯度,并移除与分类目标冲突的归因分量,从而在训练过程中稳定归因图的质量。

此外,qZACH-ViT 支持混合精度 INT8 量化,可将模型转换为可执行的 ONNX 格式。论文在 7 个 MedMNIST 数据集上进行了严格评估,每个类别仅使用 50 张训练图像,通过 10 个固定随机种子完成 280 次实验,共生成 210 个检查点并全部转换为 INT8 图。

实验结果

结果令人印象深刻:

  • 性能提升:混合精度 INT8 的 qZACH-ViT(使用 Adam 优化器)在所有 7 个数据集上的平均主要指标比 FP32 的 ZACH-ViT 基线提高了 0.0313;若结合 RASO,平均增益进一步升至 0.0368
  • 量化保真度:在 964,920 次源模型与 INT8 模型的对比中,预测一致率高达 99.9751%,主要指标的平均绝对变化仅为 0.000133,最大值也仅 0.004386。
  • 归因稳定性:在 3,600 组匹配的内在归因图中,平均余弦相似度为 0.999955,平均秩相关系数为 0.9944,平均 top-10% 重叠率达到 0.9692
  • 部署效率:ONNX 工件比源检查点体积缩小 70.0%,在 CPU 上使用单线程和四线程时,端到端速度分别提升 1.41 倍2.39 倍

RASO 还显著降低了充分性误差,并提高了输入噪声稳定性,尽管并非在所有可解释 AI 指标上都占据绝对优势。

结论与意义

qZACH-ViT 的成功表明,量化感知训练与内在可解释性可以协同工作,而无需牺牲模型性能或解释质量。该研究为在资源受限的医疗场景中部署可信赖的 AI 系统提供了实用路径——模型不仅更小更快,还能提供稳定、一致的块级证据,有助于临床决策的验证。

RASO 作为一种面向稳定性的优化方法,也为后续研究提供了新思路:通过显式约束归因梯度,可使解释更加鲁棒。未来,这一框架有望扩展到更复杂的医学影像任务,并推动边缘设备上的实时可解释诊断。

延伸阅读

  1. X 经过一年努力,重新发布重建后的 Android 应用
  2. OpenAI 对开源权重模型感到恐惧,美国也应该如此吗?
  3. 我测试了一款4TB抗量子USB驱动器,但你不必花3000美元买这种安全
查看原文