新上线今天0 投票
无遗憾的隐私保护:差分隐私推理时对齐新方法
在大语言模型(LLM)的推理阶段,如何高效地对齐模型行为与人类偏好,同时保护训练数据中的敏感信息,一直是研究热点。近期,一篇题为《Privacy Without Regret: Differentially Private Inference-Time Alignment》的论文提出了一种巧妙的方法,通过向奖励分数添加校准噪声,同时解决奖励黑客(reward hacking)和隐私泄露两大问题。
核心问题:BoN采样的双重困境
Best-of-N(BoN)采样是推理时对齐最常用的策略之一:从模型中采样N个候选回答,用奖励模型打分,选出最高分者。然而,这种方法有两个明显缺陷:
- 奖励黑客:模型可能利用奖励模型的漏洞,生成高分但质量不佳的回答;
- 隐私风险:奖励模型通常基于敏感的人类偏好数据训练,直接使用可能泄露这些信息。
关键创新:PrivBoN与PrivITP
论文提出两种新方法,均基于向奖励分数添加噪声的思路。
1. PrivBoN:Gumbel噪声的双重功效
PrivBoN(Private Best-of-N)在奖励分数上添加适当尺度的Gumbel噪声,同时实现ε-差分隐私和KL正则化对齐。有趣的是,当隐私预算超过临界值ε*时,隐私所需的噪声恰好是遗憾最优的正则化项,这意味着隐私保护不会带来额外的对齐成本,达到了信息论下界。
2. PrivITP:更稳健的隐私保护
由于ε依赖于未知的覆盖系数,论文进一步提出*PrivITP(Private Inference-Time Pessimism),结合χ²正则化拒绝采样和两阶段高斯机制。PrivITP实现事后(ε,δ)-差分隐私,且隐私成本与候选数量n无关,清晰解耦正则化参数与隐私参数,在噪声膨胀项内达到下界。
实验验证:性能与隐私兼得
研究者在多个语言模型、数据集和奖励模型上进行了实验,结果显示:
- PrivBoN和PrivITP具有缩放单调性,而BoN在n超过临界值后性能下降;
- 在相同隐私级别下,PrivITP匹配或优于PrivBoN,尤其在强隐私保护场景下优势显著。
行业意义
这项研究为推理时对齐提供了一种“免费”的隐私保护机制,可能对注重数据合规的AI应用(如医疗、金融)产生重要影响。未来,我们或许能在不牺牲模型性能的前提下,更好地保护用户偏好数据。