新上线今天0 投票
qZACH-ViT:量化感知的内在解释模型,通过递归归因稳定优化实现高效医学图像分类
引言
在医学影像分析领域,紧凑型分类器往往需要在效率与可解释性之间做出权衡。传统方法通常将两者分开处理,导致模型要么轻量但缺乏透明度,要么可解释却计算开销大。近期,一篇发表于 arXiv 的论文提出了 qZACH-ViT,一种量化感知的视觉 Transformer 变体,旨在同时实现高效部署与内在可解释性。
核心方法
qZACH-ViT 基于 ZACH-ViT 骨干网络进行扩展,摒弃了传统的 CLS token 和位置编码,转而通过递归方式生成内在的块级类别证据。其关键创新在于引入了 递归归因稳定优化(RASO):该方法通过范数匹配分类梯度与归因梯度,并移除与分类目标冲突的归因分量,从而在训练过程中稳定归因图的质量。
此外,qZACH-ViT 支持混合精度 INT8 量化,可将模型转换为可执行的 ONNX 格式。论文在 7 个 MedMNIST 数据集上进行了严格评估,每个类别仅使用 50 张训练图像,通过 10 个固定随机种子完成 280 次实验,共生成 210 个检查点并全部转换为 INT8 图。
实验结果
结果令人印象深刻:
- 性能提升:混合精度 INT8 的 qZACH-ViT(使用 Adam 优化器)在所有 7 个数据集上的平均主要指标比 FP32 的 ZACH-ViT 基线提高了 0.0313;若结合 RASO,平均增益进一步升至 0.0368。
- 量化保真度:在 964,920 次源模型与 INT8 模型的对比中,预测一致率高达 99.9751%,主要指标的平均绝对变化仅为 0.000133,最大值也仅 0.004386。
- 归因稳定性:在 3,600 组匹配的内在归因图中,平均余弦相似度为 0.999955,平均秩相关系数为 0.9944,平均 top-10% 重叠率达到 0.9692。
- 部署效率:ONNX 工件比源检查点体积缩小 70.0%,在 CPU 上使用单线程和四线程时,端到端速度分别提升 1.41 倍 和 2.39 倍。
RASO 还显著降低了充分性误差,并提高了输入噪声稳定性,尽管并非在所有可解释 AI 指标上都占据绝对优势。
结论与意义
qZACH-ViT 的成功表明,量化感知训练与内在可解释性可以协同工作,而无需牺牲模型性能或解释质量。该研究为在资源受限的医疗场景中部署可信赖的 AI 系统提供了实用路径——模型不仅更小更快,还能提供稳定、一致的块级证据,有助于临床决策的验证。
RASO 作为一种面向稳定性的优化方法,也为后续研究提供了新思路:通过显式约束归因梯度,可使解释更加鲁棒。未来,这一框架有望扩展到更复杂的医学影像任务,并推动边缘设备上的实时可解释诊断。