本文介绍 2026 年发布的 GPT-5.6。
2026 年 8 月 21 日更新:* OpenAI 将 GPT‑5.6 Sol 的 API 和积分定价下调超过 20%,为期 3 个月。*
2026 年 7 月 30 日更新:* OpenAI 将 GPT‑5.6 Luna 的价格下调 80%,GPT‑5.6 Terra 下调 20%。在此了解更多。*
继我们的有限预览之后,我们正式发布 GPT‑5.6 系列模型并全面开放:我们的新旗舰 Sol,以及
Terra,一款面向日常工作的均衡模型,和
Luna,我们最具成本效益的模型。
GPT‑5.6 Sol 在智能与效率两方面树立了新标准,在编程、知识工作、网络安全和科学领域取得最先进的结果,同时以更少的 token 和更低的预估成本超越此前及竞争的前沿模型。其结果是更高的每美元性能:相同支出完成更多成功工作,或以更低总成本获得相当的结果。我们还引入了一种加速最严苛工作的新方式:ultra
是我们能力最高的设置,可跨并行工作流协调多个智能体,更快完成复杂任务。更强的计算机使用能力和设计判断力使 GPT‑5.6 Sol 成为我们迄今最完善的协作者,帮助它检查、优化并交付可直接使用的结果。
我们训练 GPT‑5.6,旨在从每个 token 中获取更多有用工作。在 Agents’ Last Exam(在新窗口中打开) 上——一项评估跨越 55 个领域的长时间专业工作流的测试——GPT‑5.6 Sol 创下 53.6 的新高,以 13.1 分的优势超越 Claude Fable 5(自适应推理)。即使在中等推理水平下,它也以约四分之一的预估成本超越 Fable 5 达 11.4 分。这种效率延伸至更小的模型,而这对让智能更丰富、更可负担至关重要:GPT‑5.6 Terra 和 GPT‑5.6 Luna 以约十六分之一的成本超越 Fable 5。在
,一项涵盖智能体工作、编程、科学推理和通用能力的广泛智能衡量指标上,采用最大推理的 GPT‑5.6 Sol 与 Fable 5 仅差一分,同时完成任务的时间减少 61%,预估成本约为一半。
(在新窗口中打开)Artificial Analysis Intelligence Index** Agents’ Last Exam**(在新窗口中打开)
:跨专业领域的长期智能体工作流。
GPT‑5.6 发布时配备了我们迄今最强大的安全保障,旨在抵御坚定且自适应的滥用,同时不广泛限制合法工作。在全面开放之前,我们对模型和安全保障进行了迄今最广泛的评估期,将人工红队测试与大规模自动化测试相结合。在预览期间,我们与专家组织和可信合作伙伴密切合作,在更广泛发布前对防御进行压力测试并加强安全保障。由此形成的系统将训练到模型中的保护与实时检查、监控以及根据信任和风险校准的访问权限分层结合。
GPT‑5.6 Sol 是我们迄今为止最强的编程模型。在 Artificial Analysis Coding Agent Index 上,采用最大推理能力的 GPT‑5.6 Sol 创下了新的最优成绩 80,比 Fable 5 高出 2.8 分,同时使用的输出 token 不到其一半,耗时不到其一半,成本约低三分之一。这一优势贯穿整个系列:Terra 的表现略高于 Fable 5,而 Luna 则优于 Opus 4.8;它们各自所需时间约为三分之一,输出 token 约为一半,预估成本约为四分之一。它还在 Terminal‑Bench 2.1 和 DeepSWE 上创下新的最优成绩,这两项测试考察的是复杂命令行工作流以及真实代码库中的长周期工程任务。
Artificial Analysis Coding Agent Index:* 一个独立的编程智能体性能指数,涵盖实现、终端使用和真实代码库。*
GPT‑5.6 可以编写并运行轻量级程序来协调工具、处理中间结果、监控进度,并在工作推进过程中选择下一步操作。这使得工具密集型任务能够以更少的 token、更少的模型往返次数和更少的引导向前推进。开发者无需为每一步编写脚本,也无需将每个工具响应都传回模型,Responses API 中的 Programmatic Tool Calling(在新窗口中打开) 可以过滤大量中间数据,仅保留重要内容,并在此过程中调整其工作流。
对于值得投入更多时间和算力的问题,GPT‑5.6 可以突破这一高效默认设置。max
为 GPT‑5.6 提供比 xhigh
更多的时间来推理和探索替代方案、运行检查并修正其方法。ultra
则更进一步,默认并行协调四个智能体,以更高的 token 消耗换取更强的结果,并在高要求任务上更快得到结果。下图比较了 ultra 默认的四智能体设置与单智能体基线在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 上的表现;BrowseComp 和 SEC-Bench Pro 还展示了 16 智能体配置。在所有三项评估中,增加并行智能体都会将得分-延迟前沿向上并向左推移,从而在更短时间内达到更强的结果。在 API 中,开发者可以使用 Responses API 中的 multi-agent(在新窗口中打开) beta 构建类似 ultra 的体验。4、5、6
GPT‑5.6 在设计判断力上实现了跨越式提升。仅需高层级方向,GPT‑5.6 就能创建出有品位、符合人体工学且功能完善的界面。其更强的计算机使用能力使其能够检查并优化渲染结果——而不仅仅是生成底层代码或内容——因此它能够在交回工作成果之前发现视觉和功能问题并完成收尾润色。
GPT‑5.6 的前端能力还能在 ChatGPT Work 中将自然语言请求转化为精致、可交互的解释和可视化内容。
GPT‑5.6 为专业任务带来更好的结果。它从你的文档以及 Slack、Notion、Microsoft 365 和 Google Drive 等日常工作流中获取杂乱上下文,并将其转化为专家级、可共享的成果物。
GPT‑5.6 在知识工作方面的优势体现在涵盖长周期专业分析、浏览、工具使用和计算机操作的各项评估中。GPT‑5.6 Sol 在 BrowseComp 上以 92.2% 的成绩刷新了最先进水平,在 OSWorld 2.0 上达到 62.6%;在 OSWorld 上,它超越了 Opus 4.8,同时输出 token 用量减少了 85%。在这里,单位成本的性能提升贯穿整个 GPT‑5.6 系列。Luna 以不到一半的预估成本几乎达到 GPT‑5.5 的峰值性能,而 Terra 则以更低的成本超越了它。
BrowseComp:GPT‑5.6 Sol 在 BrowseComp 上达到了新的最先进水平,该基准由智能体浏览任务组成。
GPT‑5.6 Sol 提升了演示文稿、文档和电子表格的质量,生成的输出更加精致和准确。它可以从零开始创建完全可编辑的演示文稿,将提示和源材料转化为连贯的视觉叙事,具备出色的布局、层次和设计。
在遵循模板和参考幻灯片时,这一改进尤为显著。GPT‑5.6 能够推断出演示文稿的设计系统——布局、字体排印、间距、颜色以及重复出现的内容模式,包括嵌入幻灯片母版中的规则——并将这些惯例一致地应用于新素材。在此示例中,当被要求根据参考文件更新数字时,GPT‑5.5 的输出缺少母版幻灯片中的关键组件,而 GPT‑5.6 则更忠实地遵循了参考结构。
参考文件

GPT‑5.5 输出

GPT‑5.6 输出

GPT‑5.6 还能创建视觉上更精致的文档和电子表格。它更忠实地遵循复杂的参考格式,这对于可重复的知识工作活动非常重要。它更精确地处理方程和财务模型,并更好地利用字体排印、间距、层次以及页面或工作表布局。
早期测试 GPT‑5.6 的客户看到各领域的知识工作输出都有所改善。
GPT‑5.6 是我们迄今为止最强的网络安全模型,以显著更少的 token 实现了前沿性能。在 ExploitBench 2 上,该基准衡量从触及易受攻击代码到任意代码执行的进展,它在可比的输出 token 预算下得分为 73.5%,而 GPT‑5.5 为 47.9%。在
ExploitGym
3,该基准要求智能体将现实世界的漏洞转化为可用的漏洞利用程序,它几乎将 GPT‑5.5 的峰值通过率翻倍,在两小时上限下从 15.1% 提升至 24.9%;在六小时下,达到 33.7%。在
SEC-Bench Pro,该基准测试在复杂软件上生成概念验证,它得分为 71.2%,而 GPT‑5.5 为 45.8%,且延迟有所改善。
1GPT‑5.6 支持重要的防御性任务,例如安全代码审查、打补丁、威胁建模和蓝队防御。符合资格的个人和组织可通过 OpenAI Daybreak 的网络安全可信访问 计划,在授权环境中针对经过验证的工作获得更精确的安全保障,从而使用其更多的防御能力,包括漏洞分类与验证、恶意软件分析、检测工程和补丁验证。
个人可以 验证其身份并申请可信访问(在新窗口中打开),组织可以
申请在 9 月 1 日前使用硬件支持的通行密钥,以保留对我们最具网络能力的前沿模型的访问权限;未启用者将恢复为默认访问权限。尚未拥有硬件支持通行密钥的用户可以从我们的合作伙伴 Yubico 获得
高级账户安全(在新窗口中打开)。我们还在采取额外措施,限制高风险实体和高风险司法管辖区的访问。
优先定价(在新窗口中打开)*ExploitBench:*构建能力逐步增强的 V8 漏洞利用;GPT‑5.6 相较 GPT‑5.5 显示出大幅提升。未显示延迟图表,因为该基准测试的延迟估计不可靠。
GPT‑5.6 Sol 在科学研究方面也展现出广泛提升。在生命科学评估中,GPT‑5.6 在真实世界生物学、生命科学研究工作流和化学方面相较 GPT‑5.5 展现出帕累托改进。
** GeneBench Pro**
*:*长周期基因组学和定量生物学分析;GPT‑5.6 以更少的 token 和更短的时间取得更强结果。Claude Fable 5 未被纳入,因为它
不回答(在新窗口中打开)高级生物学问题,并拒绝该评估中的大多数问题。
GPT‑5.6 是我们迄今用于加速 AI 研究的最强模型。在 OpenAI 内部,研究人员将其用于整个开发循环:诊断故障、优化训练系统、运行实验和解读结果。在 GPT‑5.6 的内部测试期间,我们已经看到了这种加速和更强的采用,每位活跃研究人员的平均每日输出 token 数超过 GPT‑5.5 所观察到的最高水平的两倍。
这种工作方式正迅速成为标准。在过去六个月中,用于内部编码推理的研究算力份额增长了 100 倍,而内部智能体 token 使用量增加了约 22 倍。这些采用指标本身并不能衡量研究进展,但它们表明 AI 辅助在研究以及销售、营销、用户运营、财务等团队中的增长有多快。
为了直接衡量这一能力,我们开发了一套基于真实 AI 研究任务的内部评估,包括调试研究系统、优化内核和训练配方、运行机器学习实验以及改进另一个模型。
综合 RSI 能力:* 在一组衡量递归自我改进进展的评估中,我们观察到 GPT‑5.6 Sol 相较 GPT‑5.5 提升了 16.2 分,全面加速了内部研究。*
随着模型能力的提升,我们不断加强安全体系,使先进智能在保持广泛实用性的同时,对最高风险的使用场景施加更严格的审查。针对 GPT‑5.6,我们构建了迄今为止最稳健的安全系统,该系统根据每个模型的能力进行校准,并由比以往更多的算力驱动。
GPT‑5.6 模型在生物学和网络安全两个领域都比我们此前的模型能力更强,但均未跨越任一类别中的“关键”阈值。在网络安全方面,我们的测试表明,GPT‑5.6 更擅长发现和修复漏洞,而非可靠地对加固目标执行自主的端到端攻击——这为防御者提供了在弱点被利用之前强化系统的机会。在生物学方面,我们的测试表明,GPT‑5.6 可以支持合法研究,但不具备创建、设计或合成高度危险的新型威胁所需的端到端能力。
这两个领域本质上都具有双重用途。在网络安全中,可能帮助攻击者利用漏洞的同一能力,也可以帮助防御者发现漏洞、复现漏洞并构建可靠的修复方案。因此,过度拦截本身就会制造安全风险。它可能阻止防御者测试系统和部署补丁,而恶意行为者却继续使用其他模型(包括能力日益强大的开源模型)以及现有工具。有效的防护措施会考虑请求的上下文和可能后果,在保留合法防御工作的同时,在证据表明存在严重伤害风险的地方施加更强的控制。
GPT‑5.6 的防护措施采用分层设计,以提高准确性和冗余性,并旨在随着新攻击的出现快速适应。训练进模型中的保护机制与实时检查、持续监控和账户级执法协同工作,以帮助系统在某一特定层未按预期运行时仍保持安全。在许多系统中,仅凭分类器标记来决定拦截什么,依赖较难更改的低智能模型来防止伤害。我们的方法增加了一个推理监控器,用于审查对话以确定是否存在潜在伤害。这一设计旨在支持防御性工作,同时阻止严重滥用,最敏感的能力通过“可信访问”保留给经过验证的用户。由于部分保护措施使用测试时推理,我们可以快速更新它们以弥补缺口,而无需从头重新训练分类器。
在继续加强系统以抵御自适应攻击的过程中,我们正在采取更为保守的方法。与之前的模型相比,我们的 GPT‑5.6 Sol 网络安全防护措施拦截的潜在有害活动大约多出十倍。由于这些措施可能给良性使用带来摩擦,我们在 ChatGPT 和 Codex 中提供了一项选项,可轻松在能力较低的模型上重试提示,我们将继续减少防护措施对良性使用的影响,同时保持高稳健性标准。这体现了我们的迭代部署方法:从保守开始,并根据从真实世界使用中学到的经验不断改进。
在正式发布之前,我们进行了迄今为止最深入的安全评估,包括广泛的红队测试、与外部专家进行的稳健能力与防护措施测试,以及约 70 万 NVIDIA A100 Tensor Core GPU 等效小时的黑盒自动化红队测试。这使我们能够系统地探查可能的薄弱环节、发现越狱方式,并帮助我们在发布前强化系统。
不存在完美的安全,我们为能力日益强大的模型提供安全保障的工作仍在继续。新的弱点会被发现,绕过现有防护措施的新越狱方式也会出现。每一代新模型也会为攻击和滥用创造新的途径。我们通过分层防护、持续监控、快速修复以及防御社区的协作来应对这一现实。对于 GPT‑5.6,我们将现有的安全(在新窗口中打开)与
新的快速修复流程以及我们迄今为止最强的监控力度相结合。来自研究人员、监控和现实世界滥用的发现将持续为新的评估和更强的防护措施提供输入。
__生物学漏洞赏金计划__在我们的更新版 GPT‑5.6 系统卡(在新窗口中打开)中了解更多关于我们防护措施的信息。
GPT‑5.6 涵盖三个模型层级:Sol,我们的旗舰模型;Terra,一款成本更低、性能可与 GPT‑5.5 竞争的产品;以及 Luna,我们最快、最实惠的模型。数字标识代际,而 Sol、Terra 和 Luna 是持久的能力层级,可以按各自的节奏推进。
GPT‑5.6 从今天起在 ChatGPT、Codex 和 OpenAI API 上可用。此次推广现已在全球范围内启动,并将在未来 24 小时内逐步推进至全面可用。
Chat:Plus、Pro、Business 和 Enterprise 用户可通过中等及更高努力设置访问 GPT‑5.6 Sol。Pro 和 Enterprise 用户还可以选择 GPT‑5.6 Sol Pro,以在复杂任务上获得最高质量的结果。ChatGPT Work 和 Codex:Free 和 Go 用户可访问 GPT‑5.6 Terra。Plus、Pro、Business 和 Enterprise 用户可以在 GPT‑5.6 Sol、Terra 和 Luna 之间选择,并为每个模型设置努力级别。max
可供所有在 ChatGPT Work 和 Codex 中拥有 GPT‑5.6 访问权限的用户使用,并可在设置中开启。在 ChatGPT Work 中,ultra
可供 Pro 和 Enterprise 用户使用。在 Codex 中,它可供 Plus 及更高套餐使用。API:开发者可以通过 OpenAI API 访问 Sol、Terra 和 Luna。在 Responses API 中,程序化工具调用让 GPT‑5.6 能够在内存中编写和运行程序,以协调工具并处理中间结果,使其兼容零数据保留(ZDR)。多智能体功能最初以测试版提供,让 GPT‑5.6 能够在单个请求中运行并发的子智能体并综合它们的工作。
GPT‑5.6 按每 100 万 token 计费,涵盖三种模型规格:Sol 为输入 $5 / 输出 $30;Terra 为输入 $2.50 / 输出 $15;Luna 为输入 $1 / 输出 $6。GPT‑5.6 还引入了更可预测的提示缓存,包括支持显式缓存断点(在新窗口中打开)以及 30 分钟的最短缓存寿命。对于 GPT‑5.6 及之后的模型,缓存写入按模型未缓存输入费率的 1.25 倍计费,而缓存读取继续享受 90% 的缓存输入折扣。
专业
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
Agents' Last Exam | 52.7% | 50.4% | 50.3% | 46.9% | 40.5% | 45.2% | 32.1% | — |
GDPval-AA v2 | 1,747.8 Elo | 1,593 Elo | 1,591.8 Elo | 1,493.7 Elo | 1,759.6 Elo | 1,600.1 Elo | 962.3 Elo | 1,348.8 Elo |
管理咨询任务(内部) | 43.2% | 37.2% | 35.4% | 31.3% | 35.5% | 31.6% | 13.2% | — |
Big Finance Bench | 53% | 51% | 36% | 49% | — | 44% | — | — |
Artificial Analysis Intelligence Index v4.1 | 58.9 指数得分 | 55 指数得分 | 51.2 指数得分 | 54.8 指数得分 | 59.9 指数得分 | 55.7 指数得分 | 46.5 指数得分 | 50.2 指数得分 |
编程
评估 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
Artificial Analysis Coding Agent Index v1.1 | 80 指数得分 | — | 77.4 指数得分 | 74.6 指数得分 | 76.4 指数得分 | — | — | 77.2 指数得分 | 72.5 指数得分 | 42.7 指数得分 |
SWE-Bench Pro | 64.6% | — | 63.4% | 62.7% | 59.4% | 80.3% | 77.8% | 80% | 69.2% | 54.2% |
DeepSWE v1.1 | 72.7% | — | 69.6% | 67.2% | 67% | — | — | 69.7% | 59% | 11.8% |
Terminal-Bench 2.1 | 88.8% | 91.9% | 87.4% | 84.7% | 85.6% | 88% | — | 83.1% | 78.9% | 70.7% |
科学与健康
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
GeneBench Pro | 28.7% | 23.3% | 10.8% | 12% | — | 16% | 3.1% | 8.14% |
LifeSciBench | 59.9% | 56% | 51.2% | 50.4% | — | 53.6% | — | — |
MedChemBench(内部) | 48.3% | 35% | 30.4% | 35.5% | — | — | — | — |
HealthBench Professional⁶ | 60.5% | 57.7% | 55.7% | 49.5% | 60.9% | 53% | — | — |
计算机使用
评估 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
OSWorld 2.0 | 62.6% | — | 50.2% | 45.6% | 47.5% | — | — | 54.8% | — |
BrowseComp | 90.4% | 92.2% | 87.5% | 83.3% | 84.4% | 88% | 87.9% | 84.3% | 85.9% |
BenchCAD | 70.6% | — | 62.3% | 63.1% | 44.4% | 38.4% | 35.5% | 27.3% | — |
BenchCAD(python 工具) | 83.4% | — | 78.2% | 73.9% | 55.8% | 65% | 61% | 51.8% | — |
网络安全
评估 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 |
Capture-the-Flag 挑战 | 96.7% | — | 91.8% | 85.2% | 88.1% | — | — | — |
SEC-Bench Pro | 71.2% | 74.3% | 57.7% | 48.9% | 45.8% | — | — | — |
ExploitBench | 73.5% | — | 52.9% | 33.2% | 47.9% | 78% | 74.2% | 40% |
ExploitGym | 33.7% | — | 23.2% | 12.4% | 15.1% | — | — | — |
自我改进
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 |
内部研究调试评估 | 68.3% | 67.8% | 50.8% | 50% |
KernelGen 1P | 61.1% | 49.2% | 22.4% | 29.3% |
NanoGPT | 9.69% | 14.5% | 1.66% | 2.65% |
PostTrainBench Lite | 50.3% | 51.5% | 29.6% | 38.8% |
RSI Index | 57.9% | 56.3% | 41.9% | 41.7% |
多模态
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
MMMU Pro(无工具) | 83% | 80.7% | 78.4% | 81.2% | — | — | 80.5% |
MMMU Pro(有工具) | 84.6% | 82% | 79.5% | 83.2% | — | — | — |
gdp.pdf | 30.7% | 24.7% | 22.7% | 26% | 29.8% | 22.5% | 16.7% |
学术
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
GPQA Diamond | 94.6% | 92.9% | 92.3% | 93.6% | 94.1% | 94.6% | 92.6% | 92% | 94.3% |
FrontierMath Tier 1-3 (v2) | 89% | 84.9% | 78.6% | 85.3% | — | — | 87% | 80% | 59.6% |
FrontierMath Tier 4 (v2) | 83% | 68.3% | 58.5% | 72.5% | — | — | 87.8% | 56.1% | — |
工具使用
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
AutomationBench | 18.1% | 15.2% | 14.9% | 12.9% | — | — | 17.4% | 15.5% | — | 14.5% |
Toolathlon | 58% | 53.1% | 53.4% | 55.6% | 61.7% | 61.1% | 61.7% | 59.9% | 48.8% | — |
长上下文
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 |
OpenAI MRCR v2 8-needle 256K-512K | 91.5% | 89.6% | 41.3% | 81.5% | — | — | — |
OpenAI MRCR v2 8-needle 512K-1M | 73.8% | 72.5% | 41.3% | 74% | — | — | — |
GraphWalks BFS 256k f1 | 90.7% | 76.9% | 81.3% | 73.7% | 91.1% | 85.7% | 85.9% |
GraphWalks BFS 1mil f1 | 77.1% | 71.2% | 51.2% | 45.4% | 79.4% | 74.3% | 68.1% |
抽象推理
评估 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
ARC-AGI-3⁷ | 7.78% | 0.8% | 0.18% | 0.43% | 1.5% | 0.42% |
作者
脚注
- 1 网络能力评估在降低安全防护的情况下进行。用户可加入
以获取更多防御性网络能力访问权限。OpenAI Daybreak 的网络可信访问计划 - 2
3 我们在 alpha API 上运行了 ExploitGym,其响应输出速度比公开 API 更快,随后重新缩放以匹配公开 API。当将延迟重新缩放至公开 API 的预期速度时,这会导致部分估计延迟超过两小时和六小时的时限,尽管在评估运行中这些时限被正确遵守。为在时间敏感的工作中获得更快的速度,我们在 API 中提供优先处理,并在 Codex 中提供快速模式。
4 我们通过观察模型的生产行为并离线模拟来估计延迟和 API 成本。这些估计考虑了工具调用细节、采样 token 和输入 token。实际结果可能差异很大,并取决于我们的模拟未捕捉到的许多因素。我们以快速 API 速度模拟延迟,并以常规 API 定价模拟成本。
5
6
7
8
