校准信任,而非更精准预测:不确定性融合的实证检验
在人工智能与法律交叉领域,一个反复出现的构想是:将多种不确定性工具融合进一个流程,以提升案件结果预测的准确性。然而,一项针对欧洲人权法院真实案例的实证研究却给出了耐人寻味的结论——这类融合的真正价值不在于让预测更准,而在于建立一种“校准后的信任”。
这项研究由 Surya Saka 完成,论文发表于 arXiv(编号:2608.14617)。研究者从 LexGLUE 和 FairLex 数据集中选取了 1,000 个真实案例,利用事实段落预测法院是否认定存在《欧洲人权公约》违反行为。实验对比了三种证据评估方式:直接使用前沿大语言模型(LLM)、将 LLM 接入融合流程、以及基于词频的基线模型接入同一流程。测试在两个顶尖模型(Claude Opus 4.8 和 GPT-5.5)上进行了约 4,750 次测试。
结果出乎意料:在歧视类案件(AUROC 约 0.83)上,融合流程并未带来任何改进,直接使用前沿 LLM 反而是最强的单一判别器。更严重的是,天真地将 LLM 与贝叶斯赔率更新和 Dempster-Shafer 组合融合,会使校准误差(ECE)从约 0.16 翻倍至 0.46,且这种“先验失配”机制在两个模型上均重现。Dempster-Shafer 融合在长链条场景下甚至表现出“不安全”的行为——以低于随机水平的准确率自信地给出错误标签,因此论文建议直接移除该组件。
不过,融合流程并非一无是处。其真正的价值体现在操作层面:通过保形选择性预测层,系统可以决定哪些案件自动处理、哪些需要人工复审。在移除 Dempster-Shafer、重新校准并应用类别条件风险控制后,优化后的引擎在自动放行案件上达到了 96.8% 的准确率,仅 0.5% 的错误逃逸,96.3% 的错误被拦截送审;而未调优的基线则分别为 85.9%、3.8% 和 72.1%。
这项研究的核心启示是:在司法 AI 中,融合不确定性工具的目标不应是追求“更锋利的预测”,而是建立一种“校准后的信任”——让系统在不确定时懂得求助人类,在确定时敢于放手。这种思路或许比单纯追求准确率更具现实意义,也为法律 AI 的落地提供了新的视角。