知识追踪模型的可解释性难题:稳定且忠实的解释如何实现
当 AI 预测学生成绩,我们能相信它的解释吗?
知识追踪(Knowledge Tracing, KT)模型被广泛用于预测学生的答题表现,但其决策过程往往是一个黑箱。这种不透明性严重限制了教师基于模型输出采取教学行动的能力——如果不知道模型为什么做出某个预测,教育者就很难有针对性地干预。
一篇新发表于 arXiv 的论文 《Stable and Faithful Explanations for Knowledge Tracing》 直面这一痛点,提出了一个同时检验预测竞争力、解释稳定性和基于重训练的忠实性的验证协议。
研究方法:十三类行为特征与五种教学主题
研究团队从 ASSISTments 2009 和 2012 两个经典教育数据集出发,围绕五种教学主题构建了 13 个行为特征。其中,历史特征严格从时间上先前的交互中计算,而当前响应延迟仅保留用于回顾性分析,以避免信息泄露。
一个关键的方法论发现是:ASSISTments 2009 的未修正版本存在数据泄露问题。该版本将多技能交互按技能拆分为多行,但这些行共享同一个正确性标签,导致标签泄露到先前交互特征中。重建数据集后,模型的 AUC 下降,解释结果的排序也随之改变。这提醒研究者:数据预处理方式会实质性影响可解释性结论。
核心对比:XGBoost vs. 四种深度基线
研究采用 XGBoost 模型,并用 TreeSHAP 进行解释,与四种深度基线模型(DKT、SAKT、AKT、SimpleKT)在信息匹配协议下对比。该协议确保深度模型获得相同的行为信号,同时将 XGBoost 限制在它们所消费的标识符-正确性流可推导的范围内。
结果显示:
- XGBoost 在 2012 数据集上达到 AUC 0.777,在重建的 2009 数据集上达到 0.786;
- 排除当前响应延迟后,预测时 AUC 分别为 0.771 和 0.775;
- 当限制在基线模型的信息范围内时,XGBoost 表现与深度基线相当(0.697 vs. 0.700,0.717 vs. 0.720)。
这表明,性能差异主要源于信息供给的不同,而非模型族本身的优劣。
解释的稳定性与忠实性
在解释稳定性方面,排名在交叉验证折、随机种子和条件方案之间高度一致(Spearman rho = 0.989–1.000)。移除 TreeSHAP 排名靠前的特征比随机移除对 AUC 的损害更大,说明解释具有一定的忠实性。不过,分裂增益和排列重要性的排名表现与 TreeSHAP 相当。
值得注意的是,论文明确指出:学生层面的示例仅用于说明性解释,并非经过验证的教学建议。
为什么这件事重要
这项研究的意义在于,它将可解释性从“事后附加”提升为验证协议的核心组成部分。对于教育 AI 而言,一个预测准确但解释不稳定的模型,可能比一个稍弱但解释可靠的模型更危险——因为前者可能误导教学决策。
论文代码已公开,41 页、8 图、14 表,为知识追踪领域的可解释性研究提供了一个可复现的基准框架。
