SheepNav
新上线今天0 投票

NeuronFuzz:利用安全神经元引导模糊测试,提升大模型安全性评估效率

随着大语言模型(LLM)的广泛应用,其安全性评估变得至关重要。然而,现有的自动化测试方法往往依赖于响应级反馈,即每个候选提示都需要生成目标模型的响应来评估攻击有效性,这一过程既昂贵又对强对齐模型缺乏指导性。为此,研究者提出了 NeuronFuzz,一种白盒模糊测试框架,通过利用内部安全神经元作为连续执行反馈,显著提升安全性评估的效率与效果。

核心创新:安全神经元作为反馈信号

NeuronFuzz 的核心在于构建一个 SafetyOracle,它将安全神经元的激活转换为连续的安全警报分数。这一分数在预填充阶段即可获得,无需生成完整响应,从而将响应生成从模糊测试循环中剔除,大幅降低计算成本。为了构建 SafetyOracle,NeuronFuzz 使用模板不变的恶意与良性输入,并通过稳定性感知选择,识别出一组紧凑的安全神经元,其激活能够捕捉恶意意图识别。

优化策略:梯度引导与掩码语言模型

由于安全警报分数是可微分的,NeuronFuzz 利用其梯度来识别安全敏感的模板位置,并结合掩码语言模型生成流畅、上下文兼容的突变,同时保留原有的恶意载荷,避免引入额外的优化变量。这种设计使得生成的模板既保持攻击有效性,又具备自然语言的可读性。

实验结果:显著提升攻击发现率与迁移性

在实验部分,NeuronFuzz 在 21 个文本和多模态模型上进行了评估。在五个白盒源模型上,它实现了 76% 至 100% 的越狱发现率,比基线方法高出最多 48 个百分点。更重要的是,其优化后的模板能够零样本迁移到开源权重模型和六个专有目标模型,平均攻击成功率(ASR)和集成攻击成功率(EASR)分别达到 69.6%/92.6%44.1%/60.0%。这表明 NeuronFuzz 不仅在本模型上有效,还能跨模型泛化,展现出强大的实用价值。

行业影响与未来展望

NeuronFuzz 的提出为 LLM 安全性评估提供了一种新的思路,即从内部神经元层面而非仅依赖外部响应来指导测试。这种方法不仅降低了评估成本,还提高了对强对齐模型的测试效率。未来,该技术有望被集成到自动化安全测试工具链中,帮助开发者更快速地发现和修复模型的安全漏洞。同时,它也引发了关于模型可解释性与安全性的进一步讨论,为构建更健壮的 LLM 提供了参考。

值得注意的是,该研究目前仍处于 arXiv 预印本阶段,其实际应用效果还需进一步验证。但无论如何,NeuronFuzz 展现了利用模型内部机制改进安全评估的巨大潜力。

延伸阅读

  1. 超越能力基准:从生产事故元数据学习LLM云服务的操作指纹
  2. 无遗憾的隐私保护:差分隐私推理时对齐新方法
  3. 代数多重网格加速标签传播,实现高效半监督学习
查看原文