SheepNav
精选今天0 投票

FinProBench:基于专业交付物的角色锚定评分标准,重塑金融AI智能体评估

金融AI智能体的评估,长期以来面临一个核心难题:如何制定与真实专业工作对齐的评判标准?传统方法往往从任务提示或模型输出中提炼标准,却忽略了实践中仅体现在从业者交付物中的隐性准则。为此,研究者提出了FinProBench基准和角色锚定评分标准构建(RGRC) 方法,试图让AI评估更贴近真实金融职业要求。

从交付物中挖掘“隐性标准”

RGRC的核心思想是,与其让模型或研究者凭空定义标准,不如从真实从业者的交付物中反向提炼。其流程分为四个阶段:交付物收集、能力提取、评分标准合成与验证。这一方法不仅捕捉了隐性标准,还能区分质量层次,并在同一角色内的不同任务间迁移。

研究团队将57个金融职业按交付物类型分为30个“先验丰富”的常规角色和27个“先验稀疏”的专业角色。结果显示,在常规角色上,仅用提示词(Prompt-only)的评分标准与RGRC几乎持平(89.2% vs. 90.7%),但在专业角色上,RGRC显著胜出(99.1% vs. 78.0%)。这表明,当模型先验中已包含足够的行业惯例时,提示词工程足以近似标准;但当标准超出先验范围时,基于专业交付物的接地气构建就变得至关重要。

数据规模与初步结果

FinProBench构建了包含1723份精选交付物的数据集,覆盖57个职业、8个金融子行业、161种交付物类型,并初步发布了20个完整任务,涉及7个子行业的20个角色。在异构LLM评委和角色级评分标准下,人类交付物的平均得分最高(73.7分),而四个AI系统的得分分别为70.3、70.2和69.6分,且置信区间重叠,显示各有优势。此外,复用角色级评分标准可将每个任务的构建成本降低6.7倍,这为大规模评估提供了经济可行的路径。

对AI评估的启示

FinProBench的贡献不仅在于基准本身,更在于方法论上的启示:AI评估需要从职业实践中“生长”出来。当AI被用于专业任务时,其绩效标准不应仅由算法或提示词决定,而应扎根于该领域的真实交付物。这一思路对金融、法律、医疗等专业领域均有借鉴意义。

未来,随着更多职业的交付物被纳入,RGRC有望成为AI专业能力评估的通用范式。研究者也提醒,当前结果基于有限任务集,置信区间重叠意味着差异尚不显著,更大规模的验证仍在进行中。

延伸阅读

  1. MatrAIx:用83亿个数字人模拟真实世界,革新AI系统评估
  2. 对抗鲁棒性的溯因融合:无需领域知识,提升预训练感知模型性能
  3. BrainBench:评估大语言模型在脑电信号综合理解上的能力
查看原文