新上线今天154 投票
Qwen3.8 Max登顶智能体指数,成最强综合模型
Qwen3.8 Max 在最新发布的 Artificial Analysis 智能体指数中排名第一,成为综合能力最强的模型。这一消息在 Hacker News 上引发热议,获得 154 分和 64 条评论。
智能体指数是什么?
Artificial Analysis 是一家独立的 AI 分析机构,其智能体指数(Agentic Index)用于衡量模型在智能体任务中的综合表现,涵盖推理、编码、客户支持等多个维度。该指数基于其 Intelligence Index 方法,并不断更新评估标准。
关键更新
根据 Artificial Analysis 的更新日志,智能体指数 v4.1.1 版本于 8 月 6 日发布,将 𝜏³-Banking 升级至 v1.0.1,并将 HLE、AA-LCR 和 AA-Omniscience 的评分器升级为 GPT-5.6 Luna(medium)。同时,Qwen3.8 Max 于 8 月 5 日被正式评估,并一举登顶。
其他动态
此外,近期还有多个模型评估更新:
- Ling 3.0 Tiny 和 Ling-3.0-flash 于 8 月 5 日至 6 日发布评估。
- Muse Spark 1.2 及其变体于 8 月 5 日发布评估。
- G9v3-39A5B 于 8 月 3 日评估。
- DeepSeek V4 Flash 0731 于 7 月 31 日评估,得分 50,比此前版本高 10 分。
- Celeris-1 于 7 月 31 日评估。
- Inkling Small 于 7 月 30 日评估,参数不到 Inkling 的三分之一,但智能指数仅相差不到 1 分。
行业背景
这一排名凸显了开源模型在智能体任务中的快速进步,Qwen3.8 Max 的成功可能激励更多团队投入智能体优化。同时,Artificial Analysis 还推出了端点准确性指数(Endpoint Accuracy Index),用于衡量服务商是否真正提供与参考模型一致的性能。
小结
Qwen3.8 Max 的登顶是 AI 模型竞争白热化的又一标志,未来智能体能力将成为模型竞争的关键赛道。如需了解更多详情,可访问 Artificial Analysis 官网。



