SheepNav
精选昨天0 投票

OpenAI 发布 GPT-6.1 Sol:以五分之一价格逼近 Astra 级智能

OpenAI 正式推出 GPT-6.1 Sol,一款定位在能力与成本之间取得新平衡的模型升级。官方称,它在智能体编程、计算机操作和专业工作任务上几乎追平旗舰 GPT-6 Astra,但标准输入与输出 token 价格仅为后者的五分之一。

价格与缓存:开发者友好度大幅提升

GPT-6.1 Sol 最直接的卖点来自定价。其缓存输入价格低至每百万 token 0.10 美元,比标准输入价格便宜 95%,也比 GPT-6 Sol 的缓存输入价格低 50%。这意味着开发者在构建需要跨请求复用上下文的智能体时,可以更放心地保留长上下文,而不必过度担心成本。

编程能力:DeepSWE 上追平 Astra

在评估真实代码库中复杂软件工程任务的 DeepSWE v1.1 上,GPT-6.1 Sol 以约五分之一的成本达到与 GPT-6 Astra 相当的水平。同时,在更低的推理努力和成本下,其最佳得分比 GPT-6 Sol 高出 6.4 个百分点。

专业工作:文档理解与业务流程

针对包含表格、图表、示意图和细则的复杂 PDF 专业问答基准 GDP.pdf,GPT-6.1 Sol 在测试的推理设置下得分高于带 fallback 的 Opus 5.5,且每任务成本不到后者一半;其表现也接近 GPT-6 Astra 的最先进水平,而每任务成本仅约为 Astra 的五分之一。

在多步业务工作流基准 AutomationBench 上,GPT-6.1 Sol 在中等推理努力下得分比 Opus 5.5 高 2.2 个百分点,成本约为后者的三分之一;同一设置下,比 GPT-6 Sol 提升 4.8 个百分点。

计算机操作:OSWorld 2.0 进步显著

在评估智能体操作计算机应用工作流的 OSWorld 2.0 离线集上,GPT-6.1 Sol 在最大推理努力下比 GPT-6 Sol 高出 7 个百分点,成本不到后者一半;与 Astra 的得分差距缩小到 2.1 个百分点,而每任务成本仅约为 Astra 的七分之一。

科学研究:Terminal-Bench Science 初露头角

官方还提到,在评估数据分析、模拟和定理证明等科学工作流的 Terminal-Bench Science 0.1 上,GPT-6.1 Sol 也展现出能力进展(原文此处截断,未给出具体分数)。

行业背景与意义

GPT-6.1 Sol 的发布延续了 AI 行业近期的核心趋势:在推理成本与模型能力之间寻找更优的帕累托前沿。过去一年,前沿模型的绝对能力不断被刷新,但高昂的 token 价格让大规模智能体部署望而却步。GPT-6.1 Sol 试图证明,接近旗舰级的智能不必以旗舰级成本为代价。

对开发者而言,缓存输入价格的大幅下降尤其值得关注。智能体应用通常需要反复携带系统提示、工具定义和历史上下文,缓存成本往往是实际账单的大头。0.10 美元/百万 token 的缓存价格,可能让更多长周期、多轮次的自动化工作流变得经济可行。

当然,官方数据均来自 OpenAI 自选的基准测试,实际表现仍需第三方独立验证。但若定价与能力描述属实,GPT-6.1 Sol 有望成为专业工作与智能体场景中一个颇具竞争力的中间选项。

延伸阅读

  1. OpenAI首席研究官回应“黑客事件”:我们不会自毁长城
  2. OpenAI 首席研究官回应智能体越狱事件:我们不会自毁长城
  3. OpenAI 披露并瓦解一起协同模型蒸馏攻击行动
查看原文