SheepNav
精选昨天0 投票

无需数据库Schema:STS框架用智能体模拟生成企业级训练数据

企业AI落地最尴尬的现实之一是:模型需要海量真实业务数据来训练和评测,但法务和业务部门绝不允许把生产库随便开放。arXiv上一项新研究提出了一个有趣的思路——让智能体在模拟环境中"跑"出数据,而不是"造"出数据。

两条老路,各有硬伤

论文将现有方案归纳为两类:

  • 表格数据合成:依赖数据库Schema和种子数据,结构上容易失真,遇到复杂业务约束就力不从心;
  • 基于流程的合成:流程逻辑没问题,但分布保真度差,且每个业务域都得手工编写规则。

换句话说,一个管得住"格式"管不住"业务",另一个管得住"业务"管不住"分布"。

STS:在模拟环境里"执行"数据

作者提出的 Synthesis Through Simulation(STS) 范式跳出了这个二选一。核心思路是:让LLM智能体在一个模拟企业环境中,通过调用带策略约束的API来执行操作,数据是这些操作的"副产品"。

这带来一个优雅的性质:数据由定义"什么是合法"的同一套环境生成,结构有效性天然成立。有效性校验和分布建模因此被解耦,可以各自独立优化。

Generalist Populator的成绩单

STS的域无关智能体 Generalist Populator(GP) 负责解决分布保真度和规模化问题。论文给出的数字值得注意:

  • 在十个环境中,GP在不访问数据库Schema的前提下,平均边际保真度达到 0.88,约束满足率 100%;
  • 统计型合成器因需要必要种子数据,在七个环境中直接不适用;
  • 拥有Schema权限的智能体在航空环境紧耦合工作流中,82%的轨迹失败,原因是任务组合过于脆弱。

这组对比说明:拿到Schema并不等于拿到能力,反而可能因为过度依赖结构信息而在动态流程中翻车。

为什么这件事重要

企业级工具调用智能体的训练和评测长期受制于数据获取。STS的价值在于把"数据从哪来"这个问题,转化为"环境怎么模拟"——后者是工程问题,前者往往是法律问题。

作者已开源完整框架、十个环境和生成数据集,这对需要构建企业智能体评测基准的团队来说,是一个可以直接上手的起点。当然,模拟环境能否覆盖真实企业系统的长尾复杂性,仍需后续验证。

延伸阅读

  1. AI 拒绝机制的双刃剑:安全的屏障还是潜在的灾难?
  2. 让 AI 智能体在你的屏幕上画箭头、方框和文字:bigarrow 登陆 Hacker News
  3. OpenAI解雇三名安全研究员,当事人发公开信否认指控并警告寒蝉效应
查看原文