GPT-6.1Sol
以五分之一的价格实现接近 Astra 的智能水平
我们推出 GPT‑6.1 Sol,这是 GPT‑6 Sol 的升级版本,在智能体编程、计算机使用和专业工作方面几乎达到 GPT‑6 Astra 的智能水平,而标准输入和输出 token 价格仅为 Astra 的五分之一。缓存输入成本仅为每百万 token 0.10 美元——比标准输入价格低 95%,比 GPT‑6 Sol 的缓存输入价格低 50%——让开发者有更多空间构建和运行能够在多次请求间复用上下文的强大智能体。

GPT‑6.1 Sol 为重要的日常工作提供了能力与成本的新平衡。在从编写和调试代码到理解文档、执行多步骤业务工作流等复杂专业任务上,它相较 GPT‑6 Sol 都有显著提升。在其中若干评测中,它以大幅更低的成本接近 GPT‑6 Astra 的表现。
在 DeepSWE v1.1 上,该评测衡量在真实代码库中完成复杂软件工程任务的能力,GPT‑6.1 Sol 以约五分之一的成本达到 GPT‑6 Astra 的水平,同时以更低的推理投入和成本,将 GPT‑6 Sol 的最佳得分超出 6.4 个百分点。
在 DeepSWE 1.1(在新窗口打开)中,AI 智能体解决原创的、长周期软件工程任务。
在 GDP.pdf 上,该评测衡量模型使用复杂 PDF 文档(包括表格、图表、示意图和细则细节)回答专业问题的准确程度,GPT‑6.1 Sol 在测试的推理设置下得分高于带 fallback 的 Opus 5.5,且每任务成本不到其一半。它还在每任务成本约为五分之一的情况下,接近 GPT‑6 Astra 的最先进表现。
在 GDP.pdf(在新窗口打开)中,模型必须回答关于来自金融、医疗、法律及其他七个专业领域工作流的复杂 PDF 的真实世界提示。
在 AutomationBench 上,该评测衡量智能体是否正确完成多步骤业务工作流,GPT‑6.1 Sol 在中等推理投入下得分比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一。在同一设置下,该得分也比 GPT‑6 Sol 高出 4.8 个百分点。
在 AutomationBench 1.0.6(在新窗口打开)中,AI 智能体使用销售、营销、运营、支持、财务和人力资源领域的 47 个工具,在端到端工作流上接受测试。Claude Fable 5.1 的数据点低估了其实际成本,因为它未计入 fallback 的成本,而 fallback 在约 40% 的任务中发生。
GPT‑6.1 Sol 在需要与计算机应用程序交互的任务上也取得了实质性进展。在 OSWorld 2.0 的离线集上,该评测在要求严苛的计算机使用工作流中评估智能体,GPT‑6.1 Sol 在最大推理投入下以不到一半的成本,比 GPT‑6 Sol 高出七个百分点。在最大推理投入下,它以每任务约七分之一的成本,与 Astra 的得分相差 2.1 个百分点以内。
在* OSWorld 2.0*(在新窗口中打开)中,AI 智能体尝试跨越日常与专业任务的长时间跨度计算机使用工作流。我们报告 v2026.08.08 版本离线集上的部分奖励。
在 Terminal-Bench Science 0.1 上,该基准评估包括数据分析、模拟和定理证明在内的科学工作流,GPT‑6.1 Sol 在最大推理努力下得分超过 GPT‑6 Sol 的两倍,而每任务成本不到其一半。在最大努力下,GPT‑6.1 Sol 平均每任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元,以比两者低超过 75% 的成本提供强大的科学能力。
GPT‑6 Astra 在所有测试模型中仍取得最高分,为 68.1%,应被用于最困难的科学研究任务。
*在 *Terminal-Bench Science 0.1(在新窗口中打开)中,智能体使用代码和终端工具完成科学研究工作流,包括分析数据、运行模拟和拟合模型。
GPT‑6.1 Sol 还提高了在困难提示上的事实准确性。其相对于 GPT‑6 Sol 的最大事实性提升出现在低推理努力下,将包含事实错误的回复比例从 11.4% 降至 7.7%——减少约 32%。在测试的推理设置中,其错误率与 GPT‑6 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不到其五分之一。
该评估衡量的是在用户标记了早期模型错误的去标识化对话中,至少包含一个事实错误的答案所占比例。这些刻意设置的困难提示并不代表典型使用情况。
我们在去标识化的 ChatGPT 对话中评估事实性,这些对话中用户曾标记过先前模型的事实错误。这些诱发错误的对话并不代表典型使用情况,在典型使用中事实错误更为罕见。
GPT‑6.1 Sol 在我们的对齐评估中相较于 GPT‑6 Sol 显示出显著改进,使其更接近 GPT‑6 Astra。
GPT‑6.1 Sol 对其局限性更加透明,并且在尊重用户意图和安全约束方面更加可靠。在具有挑战性的评估中,它在搜索工具损坏时的透明度、遵守明确限制以及避免智能体任务中未经授权的后果方面,失败率低于 GPT‑6 Sol。我们未观察到任何绕过自动安全审查器的尝试,与 GPT‑6 Astra 和 GPT‑6 Sol 一致。完整细节可在 GPT‑6.1 Sol 系统卡附录(在新窗口中打开) 中找到。
以下评估刻意测试具有挑战性的情况,并不衡量典型使用中的失败率。
该评估测试智能体在搜索工具损坏时是否会告知用户,而不是给出最佳猜测。GPT‑6.1 Sol 在 2.1% 的情况下未能披露问题,而 GPT‑6 Sol 为 4.9%,GPT‑6 Astra 为 1.5%,GPT‑6 Luna 为 28.7%。任务被选中以诱发失败,并不代表典型使用情况。努力程度设为最大。
GPT‑6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 中所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。GPT‑6.1 Sol 尚未在 Chat 中提供。开发者也可以通过 OpenAI API 以 gpt-6.1-sol 访问它。其标准 API 价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。未来几天,我们还将提供 GPT‑6.1 Sol Ultrafast,在 Codex 中其 token 生成速度相比标准速度最高可快 8 倍。
作者
GPT 的评估是在我们的研究环境中或通过我们的 API 进行的,由于系统提示、可用工具、投入程度等方面的差异,其输出可能与生产环境中的 ChatGPT 略有不同。竞品模型的评估取自公开可得的报告。
