SheepNav
新上线今天182 投票

DeepSeek V4 Flash 0731:ARC-AGI 基准上的低成本高性能新星

DeepSeek 于 2026 年 7 月 31 日发布了其最新模型 DeepSeek V4 Flash 0731,该模型在 ARC-AGI 基准测试中展现出令人瞩目的性能与成本优势,迅速成为 Hacker News 上的热门话题(182 分,118 评论)。

核心亮点:性能与成本的平衡

根据官方公布的数据,在最大推理努力(Max effort)下,DeepSeek V4 Flash 0731 在 ARC-AGI-1 半私有测试集上取得了 89.0% 的准确率,而每个任务的成本仅为 $0.02;在更具挑战性的 ARC-AGI-2 半私有测试集上,准确率达到 61.4%,成本为 $0.04 每任务。这一性价比在同类模型中相当突出。

模型提供三种推理变体(Max、High、Low),以适应不同场景的需求。在官方公布的验证分数中,三种变体在 ARC-AGI-1 上的得分分别为 89.0%、87.0%、84.0%,在 ARC-AGI-2 上则为 61.4%、56.0%、46.0%。可以看出,推理强度越高,性能越强,但成本也随之增加。

任务级表现:细节中的差异

从官方披露的 ARC-AGI-2 公共评估数据(120 个任务)来看,模型在不同任务上的表现存在明显差异。例如,任务 135a2760136b006416de56c4 等在 Max、High、Low 三种变体下均能通过,而任务 0934a4d813e47133 等则仅在部分变体下成功。这种细粒度的表现数据有助于开发者了解模型的强项与短板,从而在实际应用中做出更明智的决策。

行业背景与意义

ARC-AGI 基准旨在评估人工智能系统在抽象推理和泛化能力上的表现,被视为通往通用人工智能(AGI)的重要测试之一。DeepSeek V4 Flash 0731 的发布,不仅展示了其在推理能力上的进步,更通过极低的推理成本,降低了高性能 AI 应用的门槛,为开发者和企业提供了更具吸引力的选择。

值得注意的是,该模型在 ARC-AGI-2 上的得分(61.4%)明显低于 ARC-AGI-1(89.0%),这反映出更复杂的推理任务仍具挑战性,也说明当前模型与人类智能之间仍存在差距。但考虑到其成本效益,DeepSeek V4 Flash 0731 无疑是值得关注的模型之一。

小结

DeepSeek V4 Flash 0731 以其出色的性价比和灵活的推理配置,在 AI 社区中引起了广泛关注。对于希望在有限预算内获得强大推理能力的团队而言,这无疑是一个值得探索的选项。随着模型的正式发布和更多评测数据的公开,我们有望看到它在更多实际场景中的应用表现。

延伸阅读

  1. 观看Roku的AI频道如同在食槽边进食
  2. OpenAI暂停新模型Astra开发,因安全评估显示其“过于强大”
  3. OpenAI高端智能音箱采用活动部件,旨在“更显鲜活”
查看原文