SheepNav
新上线今天0 投票

利用激活工程检测虚假信息:语言模型内部几何揭示真相

随着在线虚假信息的泛滥,开发可扩展的检测系统成为当务之急。传统方法多依赖表面语言特征或外部知识检索,但最新研究提出了一种全新视角:将真实性视为语言模型表征空间中的几何属性。来自巴西的研究团队在arXiv上发表的论文《Latent Fact-Checking: Detecting Misinformation through Activation Engineering》中,提出了一种基于激活工程的虚假信息检测框架,无需微调模型,也无需外部证据,仅通过分析模型内部的激活模式即可判断陈述的真伪。

核心方法:对比激活加法(CAA)

该方法基于对比激活加法(Contrastive Activation Addition, CAA) 原理,通过配对的真假陈述激活差异,在残差流中提取一个"虚假方向"。具体而言,研究团队利用配对数据,计算模型在处理真实与虚假陈述时最后一层token激活的均值差异,从而得到这一方向向量。在推理阶段,将待检测陈述的最后一层token激活投影到该方向上,再将投影后的表征输入一个多层感知机(MLP)进行分类。整个过程无需微调骨干模型,无需外部知识检索,也无需任务特定的监督信号,仅依赖用于估计方向的对比对。

实验结果:跨模型与基准的验证

研究团队在Gemma、Llama和Qwen三个系列的11个模型上进行了评估,参数规模从2.7亿到120亿不等,并在AVeriTeC、LIAR和FACTors三个事实核查基准上测试了方法。实验结果显示,虚假方向在不同模型规模和架构中均可恢复,且最后一层token的投影在LIAR和FACTors上匹配或超越了零样本和少样本提示基线,尤其是在较小模型上提升显著。然而,在AVeriTeC上的表现较为有限,研究团队将其归因于该基准基于证据的标注方案。

意义与展望

这项研究为可解释性驱动的虚假信息检测提供了有力证据,表明真实性在预训练语言模型的潜在空间中是一个结构化的、线性可分的概念。该方法有望成为基于检索的检测管道的实用补充,尤其在资源受限或需要快速部署的场景下。未来,该技术或可集成到社交媒体平台的内容审核系统中,实现实时、低成本的虚假信息识别。不过,研究团队也指出,当前方法在需要外部证据的复杂情境中仍有局限,未来工作将探索如何将激活工程与检索增强相结合,以进一步提升检测的鲁棒性。

延伸阅读

  1. Docker 沙箱:为 AI 代理打造的一次性隔离环境
  2. ED-CSP:从电子衍射中预测晶体结构的机器学习新框架
  3. SNI-GNN:SmartNIC辅助的全图GNN训练,在网络中预测嵌入以大幅降低通信开销
查看原文