SheepNav
新上线今天0 投票

泄露它:从黑盒语言模型中提取训练数据的概率方法

隐私审计的新视角

会员推断(MIA)通常以ROC-AUC等聚合指标来评估语言模型泄露训练数据的风险。然而,这种评估方式可能掩盖真实的风险分布。一篇新论文指出,模型无关的盲基线(如词袋分类器)仅凭文本表面特征就能区分成员与非成员,而聚合指标无法揭示具体哪些文档被泄露。

主要发现

  • 盲基线表现强劲:在WikiMIA数据集上,盲词袋分类器达到AUC 0.97(5% FPR时TPR 0.90),而采样方法并未带来额外提升。
  • 聚合指标掩盖风险:在IID Pile子集(MIMIR)上,self-concentration和gold-continuation恢复均未显著优于盲基线(增量AUC的95%置信区间包含零),但采样方法能够逐字提取特定文档的训练数据。
  • 逐文档泄露:在Pythia-6.9B模型中,500篇Pile文档中有83篇(16.6%)的真实标识符(如邮箱地址)被精确复现,且通过不匹配前缀对照排除了全局常见字符串的可能性。
  • 风险随模型规模增长:标识符泄露率从410M模型的5.6%升至6.9B模型的16.6%,代码领域的泄露强度约为散文的3倍,且散文领域仍呈正增长。
  • 其他因素:温度和核采样影响不大,16个token的前缀即可触发泄露,且语料去重并未降低风险。

结论与建议

论文强调,隐私审计应报告按领域分解的逐文档提取情况,而非单一AUC值。作者发布了开源工具leakit,用于黑盒提取审计。这一研究为评估语言模型隐私风险提供了更细致的方法,对AI安全与合规具有重要参考价值。

延伸阅读

  1. 推理时策略对齐:让强化学习智能体在部署后也能公平行事
  2. 反应幅度:预测CRISPRi扰动效应的主导信号
  3. 重新思考专业设计数据的预训练:JONES-19文化设计数据集的启示
查看原文