SheepNav
新上线今天0 投票

无遗憾的隐私保护:差分隐私推理时对齐新方法

在大语言模型(LLM)的推理阶段,如何高效地对齐模型行为与人类偏好,同时保护训练数据中的敏感信息,一直是研究热点。近期,一篇题为《Privacy Without Regret: Differentially Private Inference-Time Alignment》的论文提出了一种巧妙的方法,通过向奖励分数添加校准噪声,同时解决奖励黑客(reward hacking)和隐私泄露两大问题。

核心问题:BoN采样的双重困境

Best-of-N(BoN)采样是推理时对齐最常用的策略之一:从模型中采样N个候选回答,用奖励模型打分,选出最高分者。然而,这种方法有两个明显缺陷:

  • 奖励黑客:模型可能利用奖励模型的漏洞,生成高分但质量不佳的回答;
  • 隐私风险:奖励模型通常基于敏感的人类偏好数据训练,直接使用可能泄露这些信息。

关键创新:PrivBoN与PrivITP

论文提出两种新方法,均基于向奖励分数添加噪声的思路。

1. PrivBoN:Gumbel噪声的双重功效

PrivBoN(Private Best-of-N)在奖励分数上添加适当尺度的Gumbel噪声,同时实现ε-差分隐私和KL正则化对齐。有趣的是,当隐私预算超过临界值ε*时,隐私所需的噪声恰好是遗憾最优的正则化项,这意味着隐私保护不会带来额外的对齐成本,达到了信息论下界。

2. PrivITP:更稳健的隐私保护

由于ε依赖于未知的覆盖系数,论文进一步提出*PrivITP(Private Inference-Time Pessimism),结合χ²正则化拒绝采样和两阶段高斯机制。PrivITP实现事后(ε,δ)-差分隐私,且隐私成本与候选数量n无关,清晰解耦正则化参数与隐私参数,在噪声膨胀项内达到下界。

实验验证:性能与隐私兼得

研究者在多个语言模型、数据集和奖励模型上进行了实验,结果显示:

  • PrivBoN和PrivITP具有缩放单调性,而BoN在n超过临界值后性能下降;
  • 在相同隐私级别下,PrivITP匹配或优于PrivBoN,尤其在强隐私保护场景下优势显著。

行业意义

这项研究为推理时对齐提供了一种“免费”的隐私保护机制,可能对注重数据合规的AI应用(如医疗、金融)产生重要影响。未来,我们或许能在不牺牲模型性能的前提下,更好地保护用户偏好数据。

延伸阅读

  1. 超越能力基准:从生产事故元数据学习LLM云服务的操作指纹
  2. 代数多重网格加速标签传播,实现高效半监督学习
  3. 有限牛顿-舒尔茨迭代的Muon优化器:在非光滑非凸优化中的平滑优势
查看原文