精选昨天0 投票
无需数据库Schema:STS框架用智能体模拟生成企业级训练数据
企业AI落地最尴尬的现实之一是:模型需要海量真实业务数据来训练和评测,但法务和业务部门绝不允许把生产库随便开放。arXiv上一项新研究提出了一个有趣的思路——让智能体在模拟环境中"跑"出数据,而不是"造"出数据。
两条老路,各有硬伤
论文将现有方案归纳为两类:
- 表格数据合成:依赖数据库Schema和种子数据,结构上容易失真,遇到复杂业务约束就力不从心;
- 基于流程的合成:流程逻辑没问题,但分布保真度差,且每个业务域都得手工编写规则。
换句话说,一个管得住"格式"管不住"业务",另一个管得住"业务"管不住"分布"。
STS:在模拟环境里"执行"数据
作者提出的 Synthesis Through Simulation(STS) 范式跳出了这个二选一。核心思路是:让LLM智能体在一个模拟企业环境中,通过调用带策略约束的API来执行操作,数据是这些操作的"副产品"。
这带来一个优雅的性质:数据由定义"什么是合法"的同一套环境生成,结构有效性天然成立。有效性校验和分布建模因此被解耦,可以各自独立优化。
Generalist Populator的成绩单
STS的域无关智能体 Generalist Populator(GP) 负责解决分布保真度和规模化问题。论文给出的数字值得注意:
- 在十个环境中,GP在不访问数据库Schema的前提下,平均边际保真度达到 0.88,约束满足率 100%;
- 统计型合成器因需要必要种子数据,在七个环境中直接不适用;
- 拥有Schema权限的智能体在航空环境紧耦合工作流中,82%的轨迹失败,原因是任务组合过于脆弱。
这组对比说明:拿到Schema并不等于拿到能力,反而可能因为过度依赖结构信息而在动态流程中翻车。
为什么这件事重要
企业级工具调用智能体的训练和评测长期受制于数据获取。STS的价值在于把"数据从哪来"这个问题,转化为"环境怎么模拟"——后者是工程问题,前者往往是法律问题。
作者已开源完整框架、十个环境和生成数据集,这对需要构建企业智能体评测基准的团队来说,是一个可以直接上手的起点。当然,模拟环境能否覆盖真实企业系统的长尾复杂性,仍需后续验证。