SheepNav
新上线2天前0 投票

从因果合理性到因果可靠性:评估LLM作为校准的直接因果边分类器

近年来,大语言模型(LLM)在结构因果发现中常被用作先验因果知识的来源,但其直接边判断和置信度是否可信,一直缺乏系统验证。一项新研究对12个指令微调的开源模型进行了全面评估,覆盖6个基准因果图、5种提示策略和4种置信度来源(口头表达、基于logit、跨提示一致性和跨模型一致性),揭示了LLM在因果判断中的关键局限。

主要发现

1. 判断偏向高召回率,图密度过高

研究发现,LLM的因果判断强烈偏向于高召回率,倾向于预测过于稠密的图,包含大量假阳性边。提示策略主要影响精确率与召回率的权衡,而非解决过度预测问题。模型规模的提升在最大图上效果有限,且无法消除校准误差。

2. 难以区分直接因果与间接关联

LLM经常能捕捉到变量间的因果相关性,但无法可靠地识别直接性或方向。与参考图相比,模型将40.0%的间接边36.0%的反向非边误分类为直接边,而其他非边的误分类率仅为28.2%。更令人担忧的是,**80.8%和84.6%**的这些假阳性获得了至少80%的口头置信度,表明模型对结构性错误预测过度自信。

3. 传统置信度不可靠,一致性信号更优

基于logit的置信度常常无论正确与否都接近1.0,而跨提示和跨模型的一致性在平均校准和区分度上表现更好,尽管在Holm校正后其优势并不显著。此外,基准熟悉度审计发现5个模型-数据集对存在潜在熟悉性问题,均涉及AsiaM数据集。

对AI研究的启示

研究结果表明,LLM更适合作为外部验证的软因果先验来源,而非直接证据。在因果发现流程中,应谨慎使用LLM输出,避免将其作为确定性的因果结构。未来的研究可探索将LLM的置信度与一致性信号结合,以提升因果发现的可靠性。

这项研究为LLM在因果推理中的应用提供了重要的实证基础,也提醒我们,在利用LLM进行科学发现时,需保持批判性思维,并注重校准与验证。

延伸阅读

  1. 视频星期五:认识 Microduck
  2. Meta智能眼镜更新:限制非自愿录制,降低“偷拍”嫌疑
  3. AI 让人类医生自问:我们还能做什么?
查看原文