新上线今天123 投票
AI智能指数v4.2发布:更贴近真实应用,防作弊升级
人工智能分析机构(Artificial Analysis)于9月4日发布了其智能指数(Intelligence Index)v4.2版本,这是一次针对前沿模型快速演进的临时更新,旨在让指数更贴近真实世界应用,并通过增加私有测试集来防止模型“刷分”。
为何此时更新?
距离v4.0发布已过去8个月,机构原本计划直接推出v5版本,但近期前沿模型发展速度惊人,为了保持指数的时效性和参考价值,团队决定先行推出v4.2作为过渡。该更新引入了两项全新评估基准,并调整了权重策略。
新增AA-Briefcase与GDP.pdf评估
AA-Briefcase:这是机构内部开发的评估体系,采用私有测试集,模拟真实世界中的智能体知识工作。测试项目由行业专家构建,包含跨数周的项目任务、多个关联子任务以及数千份输入文件。评估结合了量规和成对比较,综合考察任务完成度、分析质量和演示质量,以全面衡量模型在知识工作场景中的智能体能力。
GDP.pdf:由Surge AI创建,该基准测试模型在长上下文文档推理方面的能力。模型需要处理100个PDF文档,涵盖十个领域,共计4,592页,包括文本、表格、图表、脚注和排除项。评分依据1,275条专家撰写的原子标准,只有满足所有标准才算通过(All-pass Rate),这要求模型具备极高的信息综合能力。
权重调整与防作弊
v4.2将40%的指数权重分配给私有测试集,以减少模型“刷分”的可能性。同时,GPQA Diamond(一个曾被视为科学推理标杆的测试)因已被多家模型饱和而移出评估体系。此外,评分基础设施也进行了升级,以提高鲁棒性。
展望未来
该机构表示,v5版本仍在开发中,未来将逐步发布更多增量更新。此次v4.2的快速发布体现了AI评测领域对模型能力变化的快速响应,也为用户提供了更贴近实际应用的模型能力参考。
