SheepNav
新上线今天0 投票

AI 代理评估实战:Motorway 与 AWS 联手打造生产级评估流水线

从 1/8 到 1/50:AI 代理评估的实战飞跃

英国在线汽车交易平台 Motorway 每天运营着高达 8000 名经销商竞拍 2500 辆汽车的拍卖业务。为了提升经销商查找车辆的效率,Motorway 与 AWS Prototyping and AI Customer Engineering(PACE)团队合作,构建了一款 AI 驱动的经销商库存搜索代理,让经销商通过自然语言即可完成过去需要数小时手动筛选的工作。

然而,AI 代理在真实交易场景中面临严峻挑战:工具选择错误可能导致搜索结果完全偏离,语义搜索误解可能返回无关车辆,多轮对话中的上下文漂移会让经销商的意图丢失,而模型输出的非确定性使得单次测试无法保证可靠性。一句“汽油、混合动力和电动车,车龄不超过 5 年”的查询,代理必须正确解析多个约束条件——任何一个环节出错,都会侵蚀经销商的信任。

两阶段评估策略:从构建到生产

为了解决上述问题,Motorway 和 AWS 构建了一套 端到端评估流水线,将错误结果从每 8 次查询出现 1 次降低到每 50 次查询仅出现 1 次,同时将问题检测时间从数小时缩短到几分钟。这套方案结合了 Strands Agents SDKAmazon Bedrock AgentCore,后者是专为大规模部署和运营 AI 代理而设计的全托管服务。

评估策略分为两个阶段:

  • 构建时测试:利用开源评估库 strands-agents-evals 在开发阶段进行测试。
  • 生产监控:通过 Amazon Bedrock AgentCore Evaluations 对线上代理进行持续监控。

三层评估框架:工具、推理与输出

该流水线引入了一个 三层评估框架,分别考察代理的:

  1. 工具使用:是否准确调用了正确的搜索工具?
  2. 推理过程:多步推理是否逻辑连贯、无遗漏?
  3. 输出质量:最终返回的结果是否准确且符合用户意图?

每一层都有明确的评估指标,并通过 pass^k 一致性指标 来衡量代理在多次运行中的稳定性——这一指标对非确定性输出尤为重要。

五阶段部署流水线:质量门控

为了确保每次更新都不会降低代理质量,团队设计了 五阶段部署流水线,每个阶段设置质量门控:

  • 阶段 1:单元测试与工具调用验证
  • 阶段 2:模拟对话场景的集成测试
  • 阶段 3:基于三层框架的离线评估
  • 阶段 4:金丝雀部署,监控实时指标
  • 阶段 5:全量发布,持续监控

当任一阶段的评估指标低于预设阈值时,流水线自动阻止发布,直到问题修复。

可复用的蓝图

虽然这套蓝图基于 AWS 服务(如 Lambda、DynamoDB、EventBridge、CloudWatch 等),但其核心原则是系统无关的。团队提供了 配套的代码仓库,开发者可以直接部署并适配自己的 AI 代理。

对于任何计划将 AI 代理投入生产环境的团队而言,Motorway 的实践表明:系统化的评估不是可选项,而是必需品。从构建时的离线测试到生产中的实时监控,每一层评估都在为代理的可靠性保驾护航。

延伸阅读

  1. 为代码生成工作流配置 Amazon Bedrock Guardrails 的最佳实践
  2. Alexa Plus 迎来 AI 升级:复杂指令处理能力大幅提升
  3. AMD 推出 Helios 机架级 AI 系统,剑指英伟达霸主地位
查看原文