SheepNav
精选今天0 投票

WebGrader:自学演进的程序化评分器,提升LLM网页开发能力

WebGrader 是一种新型的自演进程序化评分器,旨在解决大语言模型(LLM)在网页开发训练中的奖励设计瓶颈。通过自动生成可执行的交互流程(Flow Contract),并在真实浏览器环境中收集多维度证据,WebGrader 能够提供更准确的强化学习信号,显著提升模型的功能成功率。实验表明,在 WebGen-Bench 基准上,8B 参数模型的功能成功率达到了 52.01%,超越了多个更大规模的模型。

背景:网页生成中的奖励困境

当前,LLM 已能根据自然语言描述生成完整网站,但功能正确性仍是一大挑战。强化学习(RL)是缩小这一差距的核心方法,而奖励设计则是关键瓶颈。传统的奖励方式包括手工编写的浏览器脚本和基于视觉语言模型(VLM)或 GUI 代理的评分器。前者虽然可执行,但难以覆盖开放式需求;后者虽然可扩展,但可能在观察到关键状态前就作出判断,导致奖励不准确。

WebGrader 的解决方案

WebGrader 提出了一种全新的思路:自动从每个网站请求中推导出所需的交互流程,并将其表示为可执行的“Flow Contract”。在训练过程中,WebGrader 会在真实浏览器中运行生成的网站,将目标操作与源代码和实时 DOM 对齐,并沿着浏览器轨迹收集视觉、DOM、响应和持久状态等证据。通过分离测试规划、操作定位、证据收集和语义判断,WebGrader 只有在观察到请求的状态转换后才会给出通过(Pass)判定,从而保证了奖励的可靠性。

此外,WebGrader 还引入了一个残差驱动的离线循环,用于发现可复用的验证器技能,并在不相交的验证页面上进行筛选,最终在策略训练前冻结这些技能图。这种机制使得评分器能够不断自我演进,适应更多样的任务。

实验结果

在 WebGen-Bench 基准上,WebGrader 训练的 8B 参数策略模型达到了 52.01% 的功能成功率,比匹配的外观加脚本奖励高出 7.88 个百分点,并超过了 o4-mini 和 DeepSeek-v4-flash 等模型。在 WG-core-250 数据集上,该策略的满分(Full Score)达到 44.953,超过了 Qwen3-Coder-480B。这些结果表明,WebGrader 不仅提升了奖励的准确性,还显著增强了模型的网页开发能力。

意义与展望

WebGrader 为 LLM 在网页开发领域的训练提供了一种可扩展且可靠的奖励机制,有望推动更复杂的交互式网页生成应用。未来,这种自演进评分器或许也能应用于其他需要多步骤交互的任务,如自动化测试和机器人控制。不过,该研究仍处于 arXiv 预印本阶段,其实际应用效果还有待进一步验证。

延伸阅读

  1. 多模态大模型能否解码创意跳跃?C4框架问世,专测跨概念理解能力
  2. 预测中间层注意力:多模态大模型视觉标记剪枝新方法
  3. ADIAS:自动化设计交互式智能体系统的新框架
查看原文