重新思考基于EEG的疾病诊断:将实例表示学习与主体级监督解耦
脑电图(EEG)作为神经科学和临床医学中重要的非侵入性检测手段,其信号分析对神经系统疾病的诊断具有重要价值。然而,传统的EEG疾病诊断方法往往将长时程记录分割成短片段,并给每个片段赋予与受试者相同的标签,然后进行实例级别的分类训练。这种做法隐含了一个假设:所有实例都能提供同等可靠的诊断证据。但实际上,不同时间段、不同脑区的EEG信号可能包含不同的病理信息,这导致传统的监督学习方式可能引入噪声,影响诊断的准确性。
为了应对这一挑战,研究者提出了多实例学习(MIL)方法,将每个受试者视为一个“包”,避免直接继承标签。然而,EEG数据集中的受试者数量通常远少于实例数量,这限制了端到端MIL学习到的表示质量。为此,来自清华大学等机构的研究者提出了一种名为BridgeMIL的两阶段框架,旨在将实例表示学习与主体级监督解耦。
BridgeMIL的核心思想:第一阶段,在无监督条件下预训练编码器,通过对齐时间上邻近的窗口和独立采样的受试者内部子包,让模型学习到更具代表性的特征。同时,引入方差和协方差正则化,防止表示崩溃并减少冗余,且无需负样本对。第二阶段,将预训练好的编码器迁移到基于注意力的MIL聚合器中,仅对受试者预测施加监督,并通过特征保留机制限制表示漂移。这种方法既利用了丰富的EEG实例数据,又避免了将疾病标签错误地分配给单个实例。
实验结果:研究者在三个EEG疾病数据集和五种代表性骨干网络上进行了评估。结果显示,BridgeMIL在15个数据集-骨干设置中的14个中取得了最高平均准确率,总体平均准确率达到76.57%,比最强基线高出4.28个百分点。进一步分析发现,继承标签的可靠性在不同实例间存在显著差异,模型对受试者稀缺性的敏感度高于对实例稀缺性的敏感度,且BridgeMIL学习到的表示空间更具结构性,形成了清晰的受试者聚类,并改善了诊断类别间的分离度。
意义与展望:这项研究强调了监督信号与主体级预测目标对齐的重要性,为EEG疾病诊断提供了一种更合理的学习范式。BridgeMIL不仅提升了诊断准确率,还揭示了传统方法的潜在缺陷,为未来开发更鲁棒的生物信号分析模型提供了新思路。随着脑科学和医疗AI的快速发展,这种解耦学习策略有望在更多临床场景中发挥重要作用。