SheepNav
新上线今天0 投票

曲率密码分析:平滑Transformer前馈网络的结构提取新通道

核心发现

一项最新的机器学习安全研究揭示,平滑的Transformer前馈网络(FFN)在特定访问条件下存在一个额外的结构提取通道。该研究由Munawar Hasan和Apostol Vassilev完成,发表于arXiv(编号2608.28843),展示了如何仅通过黑盒查询,就能恢复隐藏的FFN内部结构,并实现功能替换。

攻击模型与漏洞机制

研究者假设攻击者拥有选择输入-原始输出的访问权限,即可以任意选择输入并获取FFN分支的原始输出,但无法访问模型参数、梯度或内部激活。他们发现,当FFN使用GELU或SiLU这类平滑激活函数时,输入Hessian矩阵(二阶导数)的投影会泄露内部权重矩阵的秩一因子信息。这些Hessian矩阵实际上是同一组隐藏对称秩一因子的不同混合,通过收集多个投影Hessian,可以将其形式化为一个部分对称分解问题,从而在理论上保证局部可辨识性和稳定性。

高效查询策略

为了降低查询成本,研究者利用向量输出模板复用技术,将结构查询的开销降低了16倍。在独立训练的CIFAR-10视觉Transformer上,仅需16个投影Hessian(对应8193次黑盒查询),就能恢复隐藏的FFN方向,平均绝对余弦对齐度超过0.94,其中95.1%的GELU方向和91.9%的SiLU方向对齐度超过0.90。这种恢复效果在多个独立训练模型、重复提取实验以及所有Transformer块中均保持稳定。

功能提取可行性

恢复的结构不仅能用于方向识别,还能支持功能提取。在固定恢复方向后,仅拟合剩余FFN参数,即可获得高保真度的替代模型,其top-1一致率超过93%,测试准确率分别保持在GELU和SiLU目标模型的0.90%和0.62%以内。此外,研究者还测试了防御措施的影响:输出舍入和高斯噪声会显著降低恢复效果,但通过调整有限差分步长,平均对齐度可恢复至0.9603(GELU)和0.9398(SiLU)。

安全启示

这项研究揭示了一个端到端的攻击路径:从黑盒二阶观测到隐藏FFN结构恢复,再到功能替换。它表明,在特定的oracle模型下,平滑FFN的曲率特性会暴露内部参数几何,而这种暴露是单纯行为保真度无法揭示的。这为模型安全评估提供了新的视角,尤其是在API仅暴露原始输出的场景中,模型设计者需要警惕此类二阶信息泄露。

研究局限与展望

尽管结果显著,但研究基于特定的oracle假设(选择输入、原始输出),实际攻击场景可能受限。未来工作可能探索更现实的攻击条件,或研究其他激活函数和网络架构的鲁棒性。

延伸阅读

  1. 通用编码计算迎来学习理论新基础:应对分布式系统中的慢节点问题
  2. 等变层神经网:在图上学习几何传输的新方法
  3. 无监督潜空间对齐:超球面测地线匹配新方法HGA
查看原文