SheepNav
精选今天0 投票

CHORUS:互补专家协作,高覆盖测试激励生成的新突破

在芯片设计流程中,硬件验证占据着举足轻重的地位,而测试激励生成(Testbench Stimulus Generation)则是验证环节的核心任务之一。传统的验证方法依赖人工编写测试用例,不仅耗时费力,而且难以保证覆盖率。近年来,大型语言模型(LLMs)在代码生成领域展现出巨大潜力,但如何将其有效应用于硬件验证,仍面临挑战。来自英伟达和加州大学圣迭戈分校的研究团队提出了一种名为 CHORUS 的后训练框架,通过融合多个互补的专家模型,在测试激励生成任务上取得了显著突破。

CHORUS 的核心思想源于两个关键观察:首先,分阶段的监督微调(SFT)能够产生行为多样化的模型检查点,而密集奖励的强化学习(RL)则能将这些检查点转化为性能强劲但任务侧重各异的专家模型。其次,这些专家模型的能力具有互补性,通过模型合并或进一步后训练,可以整合它们的优势,从而超越任何单一专家的表现。

研究团队将多个专家模型整合为一个 4B 参数的模型,在 CVDP-ECov 基准测试上取得了 88.0% 的 Pass@1 成绩,大幅超越了 DeepSeek-R1(671B) 的 74.5%,提升了 13.5 个百分点。这一结果令人瞩目,表明通过精心设计的后训练流程,小规模模型也能在特定任务上超越大规模模型。

CHORUS 的成功不仅验证了模型合并与专家互补策略的有效性,也为硬件验证领域带来了新的思路。传统的 LLM 应用通常采用“预训练-微调-推理”的固定范式,而 CHORUS 则展示了通过构建和整合多个专家模型,可以更高效地利用模型能力,提升任务表现。这一方法有望在芯片设计自动化(EDA)领域得到广泛应用,加速验证流程,降低设计成本。

尽管 CHORUS 目前专注于测试激励生成,但其框架具有通用性,未来可扩展至其他代码生成任务,如 RTL 设计、验证环境搭建等。随着硬件设计复杂度的不断提升,类似 CHORUS 的智能辅助工具将成为芯片工程师不可或缺的伙伴。这项研究也为 LLM 在专业领域的落地提供了宝贵经验:通过针对性的后训练与模型融合,小模型也能发挥大作用。

延伸阅读

  1. MESA:面向长时程智能体的任务自适应多结构证据选择框架
  2. AEROBAT:首个自动化行为科学研究的AI多智能体系统
  3. ReCBM:面向概念瓶颈模型的不确定性门控关系推理框架
查看原文