SheepNav
精选今天0 投票

蛋白质扩散模型测试时对齐新方法:Spectral Feedback 让模型「回头修改」生成结果

问题:扩散模型的推理是「单行道」

在蛋白质设计等领域,离散扩散模型正成为生成新序列的重要工具。为了让生成结果更符合特定目标(如更高的稳定性),研究者通常会在推理阶段引入奖励最大化对齐方法。

现有做法主要有两类:

  • 调整每一步的 token logits,引导模型往高分方向走;
  • 在中间步骤中筛选更有利的序列。

但这些方法都把推理当作一个单向过程——一旦某个 token 被选定,就几乎没有机会回头修改。如果早期选错了一个氨基酸,后续只能将错就错。

Spectral Feedback:把「改哪里」当作核心问题

来自 Shai Dickman、Mert Cemri、Landon Butler、Kannan Ramchandran 的论文 《Spectral Feedback for Test-Time Alignment of Protein Diffusion Models》(arXiv:2609.30456,被 NeurIPS 2026 接收)提出了一个新思路。

它的核心机制是:通过反馈循环选择需要编辑的位置,让模型迭代地修正自己的生成结果。具体做法借鉴了图像编辑中的思路——重新加噪、重新采样,对应到离散扩散模型上,就是重新 mask 并重新采样某些 token。

这里的关键难点在于:编辑效果是相互依赖的。修改一个 token 的影响,取决于同时还有哪些 token 被修改。为此,作者定义了一个「编辑集」(edit-set),即一组需要重新 mask 和重采样的位置。

稀疏傅里叶结构带来的效率

直接优化编辑集的价值函数在组合上非常困难。作者从生物系统中稀疏交互的既有研究中获得启发,通过实验发现:蛋白质逆折叠任务中,编辑集的价值函数具有稀疏傅里叶表示。

这一结构使得 Spectral Feedback 能够高效地学习和优化用于编辑位置选择的价值函数——把「该给 token 赋什么标签」的问题,转化为「该重新审视哪些 token」的问题。

实测效果

论文在逆折叠任务上使用蛋白质稳定性奖励作为评估信号,结果显示:

  • 对预训练模型,稳定蛋白质比例提升 32.3%;
  • 对 Best-of-10 基线,提升 24.8%;
  • 对已经过最先进 RL 微调的扩散模型,仍能提升 5.8%。

值得注意的是,Spectral Feedback 与模型无关,可应用于预训练、测试时对齐以及微调后的扩散模型,并且不修改底层生成过程。

意义与局限

这项工作提示了一个方向:测试时对齐不一定只能「向前引导」,也可以「向后修正」。对于蛋白质设计这类对序列质量敏感的应用,迭代式编辑可能比单次采样更有效。

不过,论文目前聚焦于逆折叠任务与稳定性奖励,这一方法在其他离散生成任务(如分子设计、代码生成)中的普适性仍有待验证。稀疏傅里叶结构是否在更广泛的生物序列上成立,也是后续值得关注的问题。

延伸阅读

  1. Anthropic 发布 Claude Sonnet 5.5:速度提升 30%、成本降低 30%,Terminal-Bench 得分从 10.3% 跃升至 70.6%
  2. AI 真的做出了科学发现吗?Anthropic 的声明引发学界争议
  3. AI 代理失控谁担责?MIT 科技评论推出 AI 炒作指数
查看原文