FormulaSPIN:用自对弈微调突破自然语言生成电子表格公式的瓶颈
突破数据瓶颈:自对弈框架 FormulaSPIN 让 AI 自学写公式
电子表格软件全球用户数以亿计,但编写公式始终是普通用户的一大障碍。现有方法依赖静态监督数据,在有限标注上很快达到性能天花板。近期一篇被 ACL 2026 主会接收为 Oral 的论文提出了 FormulaSPIN,一种基于自对弈(self-play)的微调框架,无需额外数据即可实现迭代式自我改进,在 NL2FORMULA 基准上达到 74.9% 精确匹配 和 87.1% 执行准确率,超越了传统监督微调(SFT)和前沿闭源模型。
为何标准自对弈会失败?
自对弈微调(SPIN)在语言模型领域已展现潜力,但直接应用于公式生成时却遭遇困境:它会对所有不匹配的输出统一惩罚,导致执行等价但形式不同的公式被错误地当作负样本,产生矛盾梯度。例如,=SUM(A1:A10) 和 =A1+A2+...+A10 在功能上等价,但 SPIN 会将后者判为错误,造成训练信号混乱。
FormulaSPIN 的解决方案:利用可执行性作为隐式监督
FormulaSPIN 的核心洞察在于:公式生成任务天然具备 二进制可执行性——公式是否正确可以通过执行结果直接验证。这一特性可以将语义错误与有效的风格变体分离开来。
框架将训练过程建模为一个 双人博弈:
- 主玩家(当前模型)学习偏好真实标注公式而非旧版本生成的公式;
- 执行反馈 将输出按粒度排序,构建自适应课程(curriculum),先纠正语义错误,再优化风格。
此外,论文引入 ExecVote 机制:在语义层面进行投票,自然处理多个有效表述。例如,对于计算总和的请求,SUM 和 + 运算符的不同写法都能被认可,从而提升模型对多样性的包容度。
实验结果:SOTA 且无需偏好标注
在多个基准测试上,FormulaSPIN 均取得最优结果:
- NL2FORMULA 数据集:精确匹配 74.9%,执行准确率 87.1%;
- 与使用额外偏好标注(如人类反馈)训练的模型性能相当;
- 显著优于传统 SFT 方法以及 GPT-4 等闭源模型。
行业意义与未来展望
这项工作展示了自对弈在数据稀缺任务上的巨大潜力。传统上,训练高质量公式生成模型需要大量人工标注的(自然语言,公式)对,成本高昂且难以覆盖长尾场景。FormulaSPIN 通过利用执行结果作为天然监督信号,大幅降低了对人工标注的依赖。
论文作者指出,该框架不仅限于电子表格领域,未来可推广到其他可执行领域(如代码生成、数据库查询等)。随着 AI 办公助手竞争日趋激烈,这种能自我进化的模型可能成为下一波生产力工具的核心引擎。