Grok 4.6 智商指数达 61,跻身前沿,智能体性能亮眼且成本更低
SpaceXAI 最新发布的 Grok 4.6 在 Artificial Analysis Intelligence Index 上获得 61 分,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude 系列,重新将 SpaceXAI 带回 AI 智能前沿。该模型在智能体任务上表现尤为突出,同时保持了较低的推理成本,性价比优势明显。
核心数据一览
- 智能指数:61 分,较 Grok 4.5 提升 5 分,较 Grok 4.3 提升 23 分。
- 智能体基准:GDPval-AA v2 Elo 达 1753,仅次于 Claude Opus 5;在 τ³-Banking 上得分 50.7%,与 Qwen3.8 Max 并列前二;Terminal-Bench v2.1 得分 88.4%,与领先模型持平。
- 定价:输入/输出每百万 token 价格 $2/$6,较 Claude Opus 5($5/$25)和 GPT-5.6 Sol($5/$30)低 60% 以上。
- 上下文窗口:500k tokens,与 Grok 4.5 相同。
智能体性能突出,静态推理稍逊
Grok 4.6 在长周期智能体任务上的表现优于静态推理。其 GDPval-AA v2 Elo 得分 1753,与 Claude Fable 5 和 Qwen3.8 Max 在置信区间内无显著差异,但明显领先于其他模型。在 AA-Briefcase 基准上,Grok 4.6 的 Elo 为 1577,与 Claude Fable 5 相当,但落后于 Claude Opus 5 家族。值得注意的是,Grok 4.6 在任务执行中更高效,平均约 53 轮、0.5B 输入 token 即可完成任务,而 Claude Opus 5 (max) 需要约 103 轮、2.0B token。
性价比优势显著
Grok 4.6 的定价与 Grok 4.5 相同,但缓存命中价格有所上调($0.5/百万 token,此前为 $0.3)。尽管如此,其每任务成本仅 $0.84,与 Kimi K3 相当,但智能水平更高,使其位于“智能 vs 成本”的帕累托前沿。这意味着开发者可以用更低的成本获得接近顶尖的智能体能力,尤其适合需要大量调用的生产环境。
竞争格局:三强争霸,SpaceXAI 回归
当前 AI 智能指数排行榜上,Anthropic 的 Claude Opus 5(63 分)和 Claude Fable 5(62 分)仍居榜首,SpaceXAI 的 Grok 4.6 与 OpenAI 的 GPT-5.6 Sol(61 分)并列第三,领先于 Kimi K3。Grok 4.6 的发布标志着 SpaceXAI 在经历 Grok 4.3 的低谷后,迅速追赶并重回第一梯队。
未来展望
Grok 4.6 的发布进一步加剧了前沿 AI 模型的竞争。其高性能与低成本的组合可能吸引更多企业级用户,尤其是在智能体自动化领域。然而,静态推理能力仍是其短板,未来 SpaceXAI 能否在保持成本优势的同时提升推理能力,值得关注。
(注:本文数据均来自 Artificial Analysis 官方报告,未做任何推测性补充。)
