隆重推出 GPT‑6 Sol 与 Luna
将前沿智能融入你日常工作的更多方式。
本月早些时候,我们推出了 GPT‑6 Astra,这是世界上最智能、最对齐的模型。尽管最严苛、最重要的项目仍然需要 Astra 的全部深度,但工作会以不同的规模、节奏和预算发生。
正因如此,我们通过 GPT‑6 Sol 和 GPT‑6 Luna 扩展了 GPT‑6 宇宙。GPT‑6 Astra 开启了新一代智能——这些模型通过在成本效率上推进前沿,帮助将这种智能的益处更广泛地分配。我们使用与 GPT‑6 Astra 类似的方法训练了 GPT‑6 Sol 和 Luna,将 Astra 在专业工作、事实性、编程、计算机使用和对齐方面达到最先进性能背后的进步,带到了更快、更实惠的模型中。
GPT‑6 模型在成本–智能曲线上全面领先,在每一层级都结合了卓越的能力,并配有能够高效大规模交付这些能力的基础设施。缓存和推理方面的改进让我们能够以更低的成本提供这些模型,我们正通过将 Sol 和 Luna 的 API 价格相比其 GPT‑5.6 促销定价降低 50%,将这些节省直接传递给用户和客户。这些改进共同使先进 AI 在更大规模上对更多日常任务和应用变得切实可行。
GPT‑5.6 Sol → | $4 → | $20 → | 便宜 50% |
GPT‑5.6 Luna → | $0.20 → | $1.20 → | 便宜 50% |
价格按每 100 万 token 计。
GPT‑6 Astra 在各方面仍然是我们的最佳模型。当你想要最佳结果和不妥协的体验时,请选择它。
GPT‑6 Sol 和 Luna 为你已经熟悉并使用的模型带来智能升级和成本效率,覆盖对完成复杂工作最有用的各项能力。
GPT‑6 Sol 能够承担困难的工作任务,同时通过更高的使用限额和更低的成本为你留出更多迭代空间,相比价格相近的竞品模型提供更多智能和更好的结果。
在 AutomationBench(一项跨应用测试业务工作流的基准)上,GPT‑6 Sol 在 xhigh 努力程度下,以仅为 Claude Opus 5 在 max 努力程度下每任务成本的 9%,超越了后者。在高努力程度下,GPT‑6 Luna 相比其前代提升了 5.4 个百分点,每任务成本降低 58%。
在 AutomationBench 1.0.6(在新窗口打开) 中,AI 智能体在涵盖销售、营销、运营、支持、财务和人力资源的 47 个工具的端到端工作流上接受测试。Claude Fable 5.1 的数据点低估了其实际成本,因为它省略了 Opus 5 回退的成本,而该回退在约 40% 的任务上发生。
GPT‑6 Sol 也以远更低的成本超越了 Claude Fable 5.1,甚至胜过低努力程度的 GPT‑6 Astra。
---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (low) | 30.3% |
Claude Opus 5 (max) | 26.9% |
Claude Fable 5.1 配合 Opus 5 回退 (max) | 31.4% |
在 Agents’ Last Exam(评估智能体在复杂专业工作流上的表现)上,GPT‑6 Sol 在 max 努力程度下得分 56.4%,高于 Claude Opus 5 在该评估中的最高分,且每任务成本低 60%。
在 Agents’ Last Exam V1(在新窗口打开) 中,AI 智能体在跨越 55 个子行业、涵盖在计算机上执行的大多数主要专业工作领域的长周期、具有经济价值的任务上接受评估。
答案的有用性取决于事实是否准确,而我们正在持续提升事实可靠性。在我们的内部事实性评估中——该评估基于用户标记了模型错误的去标识化真实对话——GPT‑6 Sol 的错误数量约为其前代的一半,以低得多的成本接近 Astra 级别的可靠性。GPT‑6 Luna 也有显著提升;在更高的努力等级下,它以约百分之一的成本达到 GPT‑5.6 Sol 的水平。
此处我们基于去标识化的 ChatGPT 对话评估事实性,这些对话中用户曾标记过先前模型的事实错误。这些诱发错误的对话并不代表典型使用场景,在典型使用中事实错误更为罕见。评分未对长度进行控制;不过,我们的冗长度扫描显示答案长度几乎不影响结果。
今年,编程智能体开始处理比以往任何时候都更复杂、范围更广、持续时间更长的任务。在 OpenAI,我们的内部使用量呈指数级增长。按 API 价格计算,中位数研究员的每日 token 使用量已超过 600 美元,第 90 百分位的研究员则超过 7,000 美元(研究加速:OpenAI 内部视角)。随着编程智能体承担更长、要求更高的任务,持续使用的成本变得更加重要。GPT‑6 Sol 和 Luna 将强大的编程性能与更低的 API 价格相结合,让开发者有更多空间进行迭代,也让团队有信心对 Codex 提出更宏大的要求。
在 FrontierCode 上——该基准评估编程智能体产出的改动是否可直接合并进真实代码库——GPT‑6 Sol 相比 GPT‑5.6 Sol 有显著提升,并且能够以低得多的成本匹敌 Claude Fable 5.1 xhigh。
*在 *FrontierCode 1.1 Main(在新窗口打开)中,AI 智能体编写的代码不仅按正确性评分,还按“可合并性”评分:例如测试质量、范围把控、代码风格以及对代码库规范的遵循。
在 DeepSWE v1.1 上——该基准测试在真实代码库中完成复杂软件工程任务的表现——GPT‑6 Sol 在最大努力下得分为 68.8%,与 Claude Fable 5 在该评估中的最高分(xhigh 努力下 69.9%)相差 1.1 个百分点以内,而每任务成本约低 80%。
GPT‑6 Luna 在最大努力下得分为 66.6%,与中等努力下的 Claude Opus 5 和 Fable 5 相当。在这些比较中,Luna 每任务成本比 Opus 5 低 93%,比 Fable 5 低 96%。
*在 *DeepSWE 1.1(在新窗口打开)中,AI 智能体解决原创的、长时程的软件工程任务。
尽管 GPT‑6 Astra 仍是全球最强的计算机使用模型,GPT‑6 Sol 和 Luna 提供了比其前代更具成本效益的性能。在 OSWorld 2.0 离线上,GPT‑6 Sol 在 xhigh 努力下取得与中等努力下的 Claude Opus 5 相近的分数——60.5% 对 60.3%——而每任务成本约低 80%。GPT‑6 Luna(max)能够以十分之一的成本超过 GPT‑5.6 Sol(medium)。
*在 *OSWorld 2.0(在新窗口打开)中,AI 智能体尝试跨越日常与专业任务的长时程计算机使用工作流。我们报告 v2026.08.08 版本离线集上的部分奖励。
我们还将 GPT‑6 Astra 改进后的沟通风格带到了 Sol 和 Luna 上,我们认为这在技术和编程对话中会尤为明显。可以期待更清晰的表达、更少的术语、更少奇怪的措辞、更少低价值的细节,以及整体上略微更简短的回答,同时不损失实质内容。
尽管风格是主观的,但我们更偏好 GPT‑6 Sol 在此处的回复。它不会那么快下结论,花更少时间重复对提问者来说可能显而易见的细节(例如,该网站有四个页面),使用更少含糊的措辞(例如,“便当感”、“围绕那个系统重塑……”),更坦率地说明它检查了什么、没检查什么,并且不会不必要地分享诸如其图像工具提示词之类的实现细节。
除了更低的 token 价格外,我们还在帮助基于 GPT‑6 构建的开发者在其应用复用的上下文上节省更多。我们改进了 GPT‑6 的提示缓存,默认提供更高的缓存命中率,帮助智能体复用更多上下文、更快响应,并享受缓存输入 token 读取 90% 的折扣。
开发者还有更多方式来衡量和优化其缓存性能:
监控与诊断。该功能显示有多少输入被缓存以及其随时间的变化。提示缓存仪表板(在新窗口中打开)有助于解释错失的缓存机会以及需要修复的内容。诊断工具(在新窗口中打开)在不破坏缓存的情况下调整推理投入和工具可用性。对更难的任务提高__推理投入__(在新窗口中打开),对更简单的后续任务降低它,并随着智能体需求的变化__启用或禁用工具__(在新窗口中打开)。这两项控制现在都会保留先前的上下文以供缓存复用。优化哪些前缀被缓存。显式断点让开发者选择缓存提示前缀的结束位置。这使开发者对缓存复用有更多控制,并能提升性能。
GitHub 报告称,在过去几个月里,这些改进使 OpenAI 模型数十亿次请求中需要全新处理的提示 token 占比降低了 50% 以上,帮助 Copilot 更快响应。
GPT‑6 Sol 和 Luna 建立在我们迄今为止对齐程度最高的模型 Astra 所引入的对齐工作之上。在我们的对齐评估中,Sol 和 Luna 均较其 GPT‑5.6 对应版本有所改进,包括关于其编程工作的误导性说法的比率更低。
以下评估刻意测试具有挑战性的情境,并不衡量典型使用中的失败率。完整结果请参见系统卡(在新窗口中打开)。
GPT‑6 Sol 和 GPT‑6 Luna 从今天起在 ChatGPT Work 和 Codex 中面向所有 Plus、Pro、Business、Enterprise 和 Edu 用户提供。Free 和 Go 用户可以在桌面应用中访问 GPT‑6 Luna。这些模型尚未在 Chat 中提供。在 OpenAI API 中,它们以 gpt-6-sol
和 gpt-6-luna
的形式提供。
为了保持对所有人的服务稳定,我们计划在一天内逐步在 ChatGPT 中推出这些模型。如果您在 ChatGPT Work 或 Codex 中看不到新模型,请稍后再试。
GPT 的评估是在我们的研究环境中或通过我们的 API 进行的,由于系统提示、可用工具等方面的差异,其输出可能与生产环境中的 ChatGPT 略有不同。竞品模型的评估取自公开报告。在无法获得 Claude Fable 5.1 的分数时,报告的是 Claude Fable 5 的分数。
