个性化评分建模:一种基于学习的多专家睡眠阶段标签生成框架
睡眠阶段自动分类是睡眠障碍诊断与管理的核心环节,但长期以来,大多数自动分期研究都依赖单一参考睡眠图(hypnogram)作为金标准,忽略了不同评分者之间的主观差异。这种“单专家”评估模式可能掩盖模型在真实世界中的表现波动。
针对这一问题,一项来自伊朗研究团队的最新研究提出了一种基于学习的个性化评分建模框架(LBH),旨在从多位专家的评分中聚合出更稳健的参考标签。该研究已在 arXiv 上发布(编号:2608.12446),并采用公开数据集 DOD-H 和 DOD-O 进行验证。
核心方法:从“投票”到“概率聚合”
传统做法通常采用多数投票或选择“最佳评分者”作为参考,但这会丢失个体专家的独有信息。LBH 的思路截然不同:它为每位评分者建立个性化混淆矩阵,利用机器学习模型(随机森林、支持向量机、多层感知机)学习每位评分者对不同睡眠阶段的误判模式。
具体而言,研究团队从 EEG(C3-M2)和下颌肌电(chin EMG)信号中提取特征,每 30 秒为一个 epoch,共提取 60 个特征(EEG 与 EMG 各 30 个)。随后,通过列归一化后的混淆矩阵,估计“在评分者给出某标签时,真实睡眠阶段为各阶段的概率”。最后,将所有评分者的概率进行聚合,为每个 epoch 分配最终标签。
结果:全面优于传统基线
实验在 EEG-only 和 EEG+EMG 两种设置下进行,并与数据集原始睡眠图(DH)及最佳评分者睡眠图(BSH)进行对比。结果显示,LBH 在所有分类器和特征组合下均取得了一致性提升。
最佳表现出现在随机森林 + EEG+EMG 组合:在 DOD-H 数据集上,准确率达到 86.07%,精确率 85.46%,F1 分数 85.29%;在 DOD-O 数据集上,准确率为 86.04%,精确率 85.21%,F1 分数 84.70%。
意义与展望
这项研究的价值在于,它没有简单地将多专家评分压缩为单一“正确答案”,而是保留了每位专家的判断特征,通过概率建模实现了更可靠的参考标签生成。这种方法不仅适用于睡眠分期,也可能推广到其他依赖主观标注的医学影像、病理分析等领域。
当然,该框架仍处于验证阶段,其泛化性需在更多样化的数据集和临床环境中进一步检验。但至少,它为“如何从多个专家中学习”提供了一个值得借鉴的范式。