SheepNav
新上线昨天0 投票

路由信息也会泄密:MoE 模型的路由器遥测如何暴露微调数据成员身份

一个被忽视的隐私面

混合专家(MoE) 架构如今是大模型扩展的主流路线之一,但一篇新论文指出,MoE 在推理时产生的路由信息(router telemetry) 可能成为一个额外的隐私泄露渠道。

这篇题为《When Routing Reveals Membership: Privacy Leakage from MoE Router Telemetry》的论文(arXiv:2610.10616)由 Yixin Tan、Jiayang Liu、Lu Sun、Yuke Hu、Zheng Li、Rui Wen 等人完成。研究提出的核心问题是:路由器遥测能否揭示某个样本是否被用于微调目标模型?

攻击方法与关键结果

作者设计了路由器增强的成员推断攻击(router-augmented membership inference attack):

  • 将传统的输出侧信号与聚合后的路由特征结合;
  • 使用在独立微调的影子模型(shadow models) 上训练出的成员分类器,迁移到目标模型上。

在 3 种 MoE 架构 × 3 个数据域 共 9 个设置中,路由器遥测相比仅使用强输出信号集成,一致地提升了成员推断效果——在 1% 假阳性率(FPR)下,真阳性率(TPR)提升 2.7 至 9.4 个百分点。

更值得关注的是泄露的普遍性:

  • 无论全量微调、冻结路由器训练、LoRA 还是指令微调,泄露都持续存在;
  • 仅凭离散的专家选择、受限的遥测数据,甚至单个影子模型,泄露仍可被观测到。

机制解释:不是路由器记住了数据

论文的机制分析给出了一个反直觉的结论:泄露并不依赖路由器本身的记忆。微调会把成员信息注入隐藏表示中,而路由器即使参数被冻结,也会暴露这一信号的某种投影。只有当遥测保真度下降时,这种额外泄露才会随之减弱。

行业启示

对部署 MoE 模型的团队而言,路由日志常被用于监控、调试、负载分析和安全审计,属于常规运维数据。这项研究提示:这些运维信号可能把内部计算视图转化为新的隐私攻击面。在模型微调越来越普遍、数据合规要求日趋严格的背景下,遥测数据的采集范围、访问权限与脱敏策略,或许需要被重新评估。

需要注意的是,这是一篇预印本论文,结论仍待同行评审与更广泛复现验证。

延伸阅读

  1. Anthropic无法可靠控制AI智能体,切断内部评估的实时互联网访问
  2. Prime Agent 用 Rust 重写:2000 个 AI 智能体协作完成自我重写
  3. 乌克兰无人机袭击俄罗斯AI数据中心,Yandex超级计算机受损
查看原文