SheepNav
Agent-Eval

Agent-Eval

agenteval.dev

统计回归测试,验证智能体行为漂移

21天前制作者:Sourav Nandy

关于 Agent-Eval

Agent-Eval 是一款专为 LLM 智能体设计的统计回归测试工具,通过对比版本 A 与版本 B 在 50 次运行中的表现,计算 p 值、Cohen's d 和 95% 置信区间,以严谨的统计证据证明行为是否发生显著变化。它突破了传统测试工具(如 DeepEval、Braintrust、Promptfoo)仅针对单次响应设定阈值的局限,聚焦于分布漂移的量化分析,为智能体迭代提供科学依据。

核心功能

Agent-Eval 的核心在于其统计驱动的测试方法论。用户只需运行同一组测试用例 50 次,即可获得可靠的统计指标,无需手动分析大量输出。该工具完全自托管,采用 Apache 2.0 许可,无需订阅任何 SaaS 服务,保障数据隐私与成本可控。

主要特性

  • 统计显著性检验:自动计算 p 值、效应量(Cohen's d)和置信区间,直观展示行为差异的显著性。
  • 分布漂移检测:超越单点评估,捕捉智能体输出的整体分布变化,识别细微但重要的行为偏移。
  • 框架原生支持:与 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 无缝集成,简化测试流程。
  • 轻量部署:通过 pip install agent-regress-cli 即可快速安装,命令行界面简洁易用。
  • 开源可定制:Apache 2.0 许可允许自由修改和商用,满足企业级定制需求。

适用场景

Agent-Eval 适用于需要严格验证智能体行为稳定性的开发团队,尤其是在持续集成/持续部署(CI/CD)流程中,用于检测模型更新、提示词调整或工具变更是否引入回归问题。无论是研究实验还是生产环境,它都能提供可靠的量化支持,帮助开发者做出数据驱动的决策。

相关工具