ESQ-Bench:面向企业级Oracle数据库的NL2SQL基准测试,揭示方言泛化与静默语义分歧的挑战
自然语言转SQL(NL2SQL)模型在Spider和BIRD等基准上执行准确率已超过89%,但这些基准依赖简化的学术模式与开源SQL方言,无法真实反映企业数据库环境的复杂性。为此,研究团队推出了 ESQ-Bench——一个以Oracle为核心的NL2SQL基准,通过系统性复杂度分层和静默分歧评估,填补了企业级场景的测试空白。
基准构建:企业级复杂度分层
ESQ-Bench构建了六个填充模式,涵盖 465张表、164,682行数据(零空表),并在Oracle、PostgreSQL、MySQL和SQL Server上使用相同种子数据,确保跨数据库一致性。基准包含 550个黄金验证问答对,分为三个复杂度层级:Tier-1(95个)、Tier-2(228个)、Tier-3(227个)。评估采用四个指标:EM(精确匹配)、EX(执行匹配)、SR(语义正确性)、SD(静默分歧)。
关键发现:模型性能的层级退化
实验结果显示,GPT-4o在模式链接提示下,执行匹配率随复杂度递增而单调下降:79.8% → 60.3% → 57.2%(2026年6月),而早前142个问题的试点切片却呈相反趋势(75.6% → 80.4% → 95.8%),凸显了数据集规模与难度设计的影响。EM在所有层级均低于7%,表明精确匹配几乎无法实现;而在执行通过的查询中,静默分歧率高达73%至99%,意味着模型虽然生成了可执行的SQL,但结果语义与用户意图不符。
模型对比:闭源API vs 开源权重
Claude Sonnet 4.6在模式链接提示下表现优异,EX分别达到 87.4%、74.9%和68.7%,全面超越GPT-4o。值得注意的是,GPT-4o在零样本模式下(78.7%、73.5%、77.8%)反而在Tier-2和Tier-3超越了其模式链接版本,这归因于零样本执行率较低带来的幸存者偏差。本地部署的Llama 3.2在模式链接下整体EX仅为 13.3%(73/550),凸显了开源权重模型与企业级Oracle模式之间的巨大鸿沟。
行业启示
ESQ-Bench的发布为NL2SQL领域提供了更贴近真实企业环境的评估标准,强调了方言泛化与静默语义分歧的重要性。对于依赖NL2SQL的企业用户而言,单纯追求执行准确率远远不够,必须关注查询语义的可靠性。未来,该基准有望推动模型在复杂企业模式上的鲁棒性研究,并为多方言支持提供新方向。