蛋白质扩散模型测试时对齐新方法:Spectral Feedback 让模型「回头修改」生成结果
问题:扩散模型的推理是「单行道」
在蛋白质设计等领域,离散扩散模型正成为生成新序列的重要工具。为了让生成结果更符合特定目标(如更高的稳定性),研究者通常会在推理阶段引入奖励最大化对齐方法。
现有做法主要有两类:
- 调整每一步的 token logits,引导模型往高分方向走;
- 在中间步骤中筛选更有利的序列。
但这些方法都把推理当作一个单向过程——一旦某个 token 被选定,就几乎没有机会回头修改。如果早期选错了一个氨基酸,后续只能将错就错。
Spectral Feedback:把「改哪里」当作核心问题
来自 Shai Dickman、Mert Cemri、Landon Butler、Kannan Ramchandran 的论文 《Spectral Feedback for Test-Time Alignment of Protein Diffusion Models》(arXiv:2609.30456,被 NeurIPS 2026 接收)提出了一个新思路。
它的核心机制是:通过反馈循环选择需要编辑的位置,让模型迭代地修正自己的生成结果。具体做法借鉴了图像编辑中的思路——重新加噪、重新采样,对应到离散扩散模型上,就是重新 mask 并重新采样某些 token。
这里的关键难点在于:编辑效果是相互依赖的。修改一个 token 的影响,取决于同时还有哪些 token 被修改。为此,作者定义了一个「编辑集」(edit-set),即一组需要重新 mask 和重采样的位置。
稀疏傅里叶结构带来的效率
直接优化编辑集的价值函数在组合上非常困难。作者从生物系统中稀疏交互的既有研究中获得启发,通过实验发现:蛋白质逆折叠任务中,编辑集的价值函数具有稀疏傅里叶表示。
这一结构使得 Spectral Feedback 能够高效地学习和优化用于编辑位置选择的价值函数——把「该给 token 赋什么标签」的问题,转化为「该重新审视哪些 token」的问题。
实测效果
论文在逆折叠任务上使用蛋白质稳定性奖励作为评估信号,结果显示:
- 对预训练模型,稳定蛋白质比例提升 32.3%;
- 对 Best-of-10 基线,提升 24.8%;
- 对已经过最先进 RL 微调的扩散模型,仍能提升 5.8%。
值得注意的是,Spectral Feedback 与模型无关,可应用于预训练、测试时对齐以及微调后的扩散模型,并且不修改底层生成过程。
意义与局限
这项工作提示了一个方向:测试时对齐不一定只能「向前引导」,也可以「向后修正」。对于蛋白质设计这类对序列质量敏感的应用,迭代式编辑可能比单次采样更有效。
不过,论文目前聚焦于逆折叠任务与稳定性奖励,这一方法在其他离散生成任务(如分子设计、代码生成)中的普适性仍有待验证。稀疏傅里叶结构是否在更广泛的生物序列上成立,也是后续值得关注的问题。