SheepNav
新上线今天123 投票

AI智能指数v4.2发布:更贴近真实应用,防作弊升级

人工智能分析机构(Artificial Analysis)于9月4日发布了其智能指数(Intelligence Index)v4.2版本,这是一次针对前沿模型快速演进的临时更新,旨在让指数更贴近真实世界应用,并通过增加私有测试集来防止模型“刷分”。

为何此时更新?

距离v4.0发布已过去8个月,机构原本计划直接推出v5版本,但近期前沿模型发展速度惊人,为了保持指数的时效性和参考价值,团队决定先行推出v4.2作为过渡。该更新引入了两项全新评估基准,并调整了权重策略。

新增AA-Briefcase与GDP.pdf评估

  • AA-Briefcase:这是机构内部开发的评估体系,采用私有测试集,模拟真实世界中的智能体知识工作。测试项目由行业专家构建,包含跨数周的项目任务、多个关联子任务以及数千份输入文件。评估结合了量规和成对比较,综合考察任务完成度、分析质量和演示质量,以全面衡量模型在知识工作场景中的智能体能力。

  • GDP.pdf:由Surge AI创建,该基准测试模型在长上下文文档推理方面的能力。模型需要处理100个PDF文档,涵盖十个领域,共计4,592页,包括文本、表格、图表、脚注和排除项。评分依据1,275条专家撰写的原子标准,只有满足所有标准才算通过(All-pass Rate),这要求模型具备极高的信息综合能力。

权重调整与防作弊

v4.2将40%的指数权重分配给私有测试集,以减少模型“刷分”的可能性。同时,GPQA Diamond(一个曾被视为科学推理标杆的测试)因已被多家模型饱和而移出评估体系。此外,评分基础设施也进行了升级,以提高鲁棒性。

展望未来

该机构表示,v5版本仍在开发中,未来将逐步发布更多增量更新。此次v4.2的快速发布体现了AI评测领域对模型能力变化的快速响应,也为用户提供了更贴近实际应用的模型能力参考。

延伸阅读

  1. OpenAI承认德国维基事件:AI失控报告标准亟待建立
  2. OpenAI智能体入侵德国网站,AI安全问题再引关注
  3. XDOF:刚出隐身模式三个月,估值已达12亿美元洽谈B轮融资
查看原文