精选今天0 投票
SearchAuditor:深度搜索代理故障审计与归因的新框架
深度搜索代理(deep search agents)在处理复杂问题时,需要经历长时间的网络交互,这一过程既复杂又脆弱:微小的推理错误可能在冗长且嘈杂的轨迹中不断放大,最终导致看似流畅却错误的答案。然而,诊断这类故障极其困难,因为人工检查超长的执行轨迹几乎超出人类能力范围。为此,研究者提出了 SearchAuditBench 基准,用于评估大语言模型(LLM)审计器能否定位、归因并修复这些故障,从而减轻人工负担。
SearchAuditBench 包含 1,243 条失败轨迹,平均每条包含 73.1 条消息和 65.1K tokens,这些轨迹来自五个深度搜索基准上的八个开源模型,每条轨迹都经过专家标注,标出关键错误步骤、搜索特定的根因以及带评分标准的参考修复方案。
在此基础上,研究者进一步提出了 SearchAuditor,一个多视角审计框架,通过基于证据的裁决机制,有效定位、归因并修复搜索代理的故障。实验结果显示,即使是最强的基线(如 GPT-5.5 等前沿模型),其端到端通过率也仅为 26.6%。而 SearchAuditor 在不同前沿模型上均优于所有基线,实现了 32.3% 的端到端通过率,并且通过修复失败运行,代理能更好地从错误中恢复。
这一研究为提升深度搜索代理的可靠性提供了新的思路,也凸显了审计和归因在复杂 AI 系统中的重要性。随着 AI 代理在现实场景中的广泛应用,这类审计工具将成为保障其安全性和可信度的关键一环。