
Agent-Eval
agenteval.dev
统计回归测试,验证智能体行为漂移
21天前制作者:Sourav Nandy
关于 Agent-Eval
Agent-Eval 是一款专为 LLM 智能体设计的统计回归测试工具,通过对比版本 A 与版本 B 在 50 次运行中的表现,计算 p 值、Cohen's d 和 95% 置信区间,以严谨的统计证据证明行为是否发生显著变化。它突破了传统测试工具(如 DeepEval、Braintrust、Promptfoo)仅针对单次响应设定阈值的局限,聚焦于分布漂移的量化分析,为智能体迭代提供科学依据。
核心功能
Agent-Eval 的核心在于其统计驱动的测试方法论。用户只需运行同一组测试用例 50 次,即可获得可靠的统计指标,无需手动分析大量输出。该工具完全自托管,采用 Apache 2.0 许可,无需订阅任何 SaaS 服务,保障数据隐私与成本可控。
主要特性
- 统计显著性检验:自动计算 p 值、效应量(Cohen's d)和置信区间,直观展示行为差异的显著性。
- 分布漂移检测:超越单点评估,捕捉智能体输出的整体分布变化,识别细微但重要的行为偏移。
- 框架原生支持:与 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 无缝集成,简化测试流程。
- 轻量部署:通过
pip install agent-regress-cli即可快速安装,命令行界面简洁易用。 - 开源可定制:Apache 2.0 许可允许自由修改和商用,满足企业级定制需求。
适用场景
Agent-Eval 适用于需要严格验证智能体行为稳定性的开发团队,尤其是在持续集成/持续部署(CI/CD)流程中,用于检测模型更新、提示词调整或工具变更是否引入回归问题。无论是研究实验还是生产环境,它都能提供可靠的量化支持,帮助开发者做出数据驱动的决策。