本文介绍了 GPT-5.5。
*2026 年 4 月 24 日更新:GPT‑5.5 和 GPT‑5.5 Pro 现已在 API 中提供。系统卡也已更新,以说明所适用的额外保障措施。*
我们发布 GPT‑5.5,这是我们迄今为止最智能、最易于使用的模型,也是迈向在计算机上完成工作的新方式的下一个台阶。
GPT‑5.5 能更快地理解你想要做什么,并能自行承担更多工作。它擅长编写和调试代码、在线研究、分析数据、创建文档和电子表格、操作软件,以及跨工具协作直至任务完成。你无需仔细管理每一个步骤,而是可以把一个杂乱、多部分的任务交给 GPT‑5.5,并相信它能够规划、使用工具、检查自己的工作、在模糊不清的情况下找到方向,并持续推进。
这些提升在智能体编程、计算机使用、知识工作和早期科学研究方面尤为显著——这些领域的进展取决于跨上下文的推理以及随时间推移采取行动。GPT‑5.5 在不牺牲速度的情况下实现了智能上的这一跃升:更大、能力更强的模型通常服务速度更慢,但 GPT‑5.5 在实际服务中每 token 延迟与 GPT‑5.4 相当,同时以高得多的智能水平运行。它完成相同 Codex 任务所用的 token 也显著减少,因此不仅能力更强,效率也更高。
我们发布 GPT‑5.5 时配备了迄今为止最强的一套保障措施,旨在减少滥用,同时保留对有益工作的访问。我们在完整的安全与准备框架下评估了该模型,与内部和外部红队合作,针对高级网络安全和生物学能力增加了定向测试,并在发布前从近 200 家可信的早期访问合作伙伴处收集了关于真实用例的反馈。
今天,GPT‑5.5 正在 ChatGPT 和 Codex 中向 Plus、Pro、Business 和 Enterprise 用户推出,GPT‑5.5 Pro 正在 ChatGPT 中向 Pro、Business 和 Enterprise 用户推出。API 部署需要不同的保障措施,我们正在与合作伙伴和客户密切合作,以满足大规模提供该服务的安全与安保要求。我们很快就会将 GPT‑5.5 和 GPT‑5.5 Pro 引入 API。
| |
Terminal-Bench 2.0 | | 75.1% | - | - | 69.4% | 68.5% |
Expert-SWE(内部) | | 68.5% | - | - | - | - |
GDPval(胜出或持平) | | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
OSWorld-Verified | | 75.0% | - | - | 78.0% | - |
Toolathlon | | 54.6% | - | - | - | 48.8% |
BrowseComp | 84.4% | 82.7% | | 89.3% | 79.3% | 85.9% |
FrontierMath Tier 1–3 | 51.7% | 47.6% | | 50.0% | 43.8% | 36.9% |
FrontierMath Tier 4 | 35.4% | 27.1% | | 38.0% | 22.9% | 16.7% |
CyberGym | | 79.0% | - | - | 73.1% | - |
OpenAI 正在为智能体 AI 构建全球基础设施,使世界各地的个人和企业能够借助 AI 完成工作。在过去一年中,我们看到 AI 极大地加速了软件工程。借助 Codex 和 ChatGPT 中的 GPT‑5.5,同样的变革正开始延伸到科学研究以及人们在计算机上所做的更广泛的工作中。
在这些领域中,GPT‑5.5 不仅更智能;它在解决问题的方式上也更高效,通常能以更少的 token 和更少的重试获得更高质量的输出。在 Artificial Analysis 的 Coding Index 上,GPT‑5.5 以竞争性前沿编程模型一半的成本提供了最先进的智能水平。
Artificial Analysis Intelligence Index(在新窗口中打开) 是由外部机构运行的 10 项评估的加权平均值:AA-LCR、AA-Omniscience、CritPt、GDPval-AA、GPQA Diamond、Humanity’s Last Exam、IFBench、SciCode、Terminal-Bench Hard、τ²-Bench Telecom。
GPT‑5.5 是我们迄今为止最强的智能体编程模型。在 Terminal-Bench 2.0 上,该测试考察需要规划、迭代和工具协调的复杂命令行工作流,它达到了 82.7% 的最先进准确率。在 SWE-Bench Pro 上,该测试评估真实世界 GitHub 问题的解决,它达到了 58.6%,单次通过端到端解决的任务比以往模型更多。在 Expert-SWE 上,这是我们针对长周期编程任务的内部前沿评估,任务的人类完成时间中位数估计为 20 小时,GPT‑5.5 也优于 GPT‑5.4。
在所有三项评估中,GPT‑5.5 在使用更少 token 的同时提升了 GPT‑5.4 的分数。
该模型的编程优势在 Codex 中体现得尤为明显,它可以承担从实现和重构到调试、测试和验证的工程工作。早期测试表明,GPT‑5.5 更擅长真实工程工作所依赖的行为,例如在大型系统中保持上下文、对模糊的故障进行推理、用工具检查假设,以及将变更贯穿到周边代码库。
渲染的轨迹使用 NASA/JPL Horizons 的 Orion、月球和太阳矢量数据,并应用了显示缩放以提高可读性。
提示词:[附图片] 使用 webgl 和 vite 将其实现为一个新应用,使用来自 Artemis II 任务的真实数据。确保彻底测试该应用,直到它完全可用并且看起来像图片中的应用。密切关注行星和飞行路径的渲染。我希望能够与 3D 渲染进行交互。确保它具有真实的轨道力学。
除了基准测试之外,早期测试者表示 GPT‑5.5 展现出更强的理解系统形态的能力:为什么某些东西失败、修复需要落在哪里,以及代码库中还有哪些部分会受到影响。

“我使用的第一个具有严肃概念清晰度的编程模型。”
Every 的创始人兼 CEO Dan Shipper 将 GPT‑5.5 描述为“我使用的第一个具有严肃概念清晰度的编程模型。”
在发布一个应用后,他花了几天时间调试一个发布后的问题,然后请来他最好的工程师之一重写系统的一部分。为了测试 GPT‑5.5,他实际上把时钟倒回:该模型能否查看损坏的状态,并产生与工程师最终决定的那种重写相同的重写?GPT‑5.4 不能。GPT‑5.5 能。

“感觉真的像是在与更高的智能一起工作,而且几乎有一种尊重感。”
MagicPath 的 CEO Pietro Schirano 在 GPT‑5.5 将一个包含数百项前端和重构更改的分支合并到一个也发生了重大变化的主分支时,看到了类似的阶跃变化,在大约 20 分钟内一次性解决了这项工作。
测试过该模型的资深工程师表示,GPT‑5.5 在推理和自主性方面明显强于 GPT‑5.4 和 Claude Opus 4.7,能够提前发现问题,并在没有明确提示的情况下预测测试和审查需求。在一个案例中,一位工程师要求它重新架构一个协作文档编辑器中的评论系统,回来时发现一个包含 12 个差异的堆栈已接近完成。其他人表示,他们需要的实现修正少得令人惊讶,并且与 GPT‑5.4 相比,他们对 GPT‑5.5 的方案更有信心。
一位提前获得该模型访问权限的 NVIDIA 工程师甚至说:“失去对 GPT‑5.5 的访问权限,感觉就像我被截肢了一样。”
“GPT-5.5 明显比 GPT-5.4 更聪明、更执着,编码性能更强,工具使用更可靠。它能在任务上坚持显著更长的时间而不提前停止,这对于我们的用户委托给 Cursor 的复杂、长时间运行的工作最为重要。”
让 GPT‑5.5 在编码方面表现出色的那些优势,同样使它在计算机上的日常工作方面变得强大。由于该模型更擅长理解意图,它能够更自然地走完知识工作的完整循环:查找信息、理解关键所在、使用工具、检查输出,并将原始材料转化为有用的东西。
在 Codex 中,GPT‑5.5 在生成文档、电子表格和幻灯片演示方面优于 GPT‑5.4。Alpha 测试人员表示,它在运营研究、电子表格建模以及将杂乱的业务输入转化为计划等工作上超越了过去的模型。当与 Codex 的计算机使用技能结合时,GPT‑5.5 让我们更接近这样一种感觉:模型能够真正与你一起使用计算机:看到屏幕上的内容、点击、输入、浏览界面,并精准地在各种工具之间切换。
OpenAI 的团队已经在实际工作流程中利用这些优势。如今,公司超过 85% 的员工每周都在使用 Codex,涵盖软件工程、财务、传播、营销、数据科学和产品管理等多个职能。在传播团队,团队使用 Codex 中的 GPT‑5.5 分析了六个月的演讲请求数据,构建了评分和风险框架,并验证了一个自动化 Slack 代理,使低风险请求可以自动处理,而较高风险的请求仍会转交人工审核。在财务团队,团队使用 Codex 审查了 24,771 份 K-1 税表,总计 71,637 页,采用了一个排除个人信息的流程,帮助团队比上一年将这项任务加速了两周。在市场推广团队,一名员工自动化了每周业务报告的生成,每周节省 5-10 小时。
在 ChatGPT 中,GPT‑5.5 Thinking 为更困难的问题提供更快的帮助,答案更智能、更简洁,帮助你更高效地处理复杂工作。它擅长编码、研究、信息综合与分析以及文档密集型任务等专业工作,尤其是在使用插件时。
在 GPT‑5.5 Pro 中,早期测试人员看到 ChatGPT 所能承担工作的难度和质量都有显著提升,延迟的改善使其对于高要求任务更加实用。与 GPT‑5.4 Pro 相比,测试人员发现 GPT‑5.5 Pro 的回复显著更全面、结构更清晰、更准确、更相关、更有用,在商业、法律、教育和数据科学领域表现尤为强劲。
GPT‑5.5 在多个反映此类工作的基准测试中达到了最先进的性能。在 GDPval 上,该测试考察智能体在 44 种职业中产出规范明确的知识工作的能力,GPT‑5.5 得分为 84.9%。在 OSWorld-Verified 上,该测试衡量模型能否自主操作真实计算机环境,它达到了 78.7%。而在 Tau2-bench Telecom 上,该测试考察复杂的客户服务工作流,它在无需提示调优的情况下达到了 98.0%。GPT‑5.5 在其他知识工作基准测试中也表现强劲:FinanceAgent 上为 60.0%,内部投资银行建模任务上为 88.5%,OfficeQA Pro 上为 54.1%。
Tau2-bench Telecom 在运行时未进行提示调优(并以 GPT‑4.1 作为用户模型)。GPT‑5.5 比其前代模型更好地理解任务意图,并且 token 效率更高。
“GPT-5.5 提供了执行密集型工作所需的持续性能。该模型在 NVIDIA GB200 NVL72 系统上构建并提供服务,使我们的团队能够从自然语言提示端到端交付功能,将调试时间从数天缩短到数小时,并在复杂代码库中将数周实验转化为一夜之间的进展。这不仅仅是更快的编码——这是一种全新的工作方式,帮助人们以根本不同的速度运作。”
GPT‑5.5 在科学和技术研究工作流上也展现出提升,这些工作流需要的不仅仅是回答一个难题。研究人员需要探索一个想法、收集证据、检验假设、解释结果,并决定下一步尝试什么。GPT‑5.5 比其他模型更擅长在这一循环中持续坚持。
值得注意的是,GPT‑5.5 在 GeneBench(在新窗口中打开) 上相较 GPT‑5.4 显示出明显改进,这是一项新的评估,聚焦于遗传学和定量生物学中的多阶段科学数据分析。这些问题要求模型在极少监督指导下对可能模糊或错误的数据进行推理,应对诸如隐藏混杂因素或 QC 失败等现实障碍,并正确实现和解释现代统计方法。鉴于这里的任务往往对应科学专家数天乃至数天的项目,该模型的性能令人瞩目。
同样,在 BixBench(在新窗口中打开) 上,这是一个围绕真实世界生物信息学和数据分析设计的基准测试,GPT‑5.5 在已公布分数的模型中取得了领先性能。该模型的科学能力如今已足够强大,能够作为真正的共同科学家,切实加速生物医学研究前沿的进展。
在另一个例子中,一个带有自定义测试框架的 GPT‑5.5 内部版本帮助发现了一个关于拉姆齐数的新证明(在新窗口中打开),拉姆齐数是组合数学中的核心对象之一。组合数学研究离散对象如何组合在一起:图、网络、集合和模式。拉姆齐数大致问的是,一个网络必须有多大,才能保证某种秩序出现。这一领域的结果很少,而且往往在技术上很困难。在这里,GPT‑5.5 找到了一个关于非对角拉姆齐数的长期渐近事实的证明,后来在 Lean 中得到了验证。这一结果是一个具体例子,说明 GPT‑5.5 不仅贡献代码或解释,还在一个核心研究领域中贡献了一个令人惊讶且有用的数学论证。
早期测试者使用 ChatGPT 中的 GPT‑5.5 Pro 时,更像是在与一位研究伙伴合作,而不是把它当作一次性答案引擎:多轮批评手稿、对技术论证进行压力测试、提出分析建议,并结合代码、笔记和 PDF 上下文开展工作。共同点是,GPT‑5.5 更擅长帮助研究人员从问题走向实验,再走向产出。
Derya Unutmaz 是杰克逊基因组医学实验室的免疫学教授兼研究员,他使用 GPT‑5.5 Pro 分析了一个包含 62 个样本、近 28,000 个基因的基因表达数据集,生成了一份详细的研究报告,不仅总结了发现,还提出了关键问题和见解——他说这项工作原本需要他的团队花费数月时间。
Bartosz Naskręcki 是波兰波兹南密茨凯维奇大学的数学助理教授,他在 Codex 中使用 GPT‑5.5,仅凭一个提示就在 11 分钟内构建了一个代数几何应用,可视化二次曲面的交线,并将所得曲线转换为 Weierstrass 模型。
他后来扩展了这个应用,加入了更稳定的奇点可视化和可在后续工作中复用的精确系数。对他来说,更大的转变在于,Codex 现在可以帮助实现以前需要专用工具才能完成的定制数学可视化和计算机代数工作流。这些例子共同表明,GPT‑5.5 正在将专家意图转化为可用的研究工具和分析。

提示:# 代数几何曲面交线
制作一个应用,绘制两个二次曲面,并将交线用红色着色。使用计算 Riemann-Roch 定理将其转换为 Weierstrass 曲线。
主窗口
两个带色调的曲面,具有轻微透明阴影、高质量渲染,沿一条红色代数曲线相交
鼠标可在两个方向上旋转,完整的捏合缩放机制,触觉按压可显示带有滑块的小菜单,用于更改每个曲面的系数;通过 Z-buffer 层级进行检测
右侧窗口
通过有效的 Riemann-Roch 定理公式即时计算的短 Weierstrass 方程(在 Q 或二次域扩张上)
环境模式,其中所有控件都被隐藏,用户可以欣赏形状之美
规格
应用在浏览器中运行,轻量级实现,使用全栈最新库,可移植,可部署
文档
Git 仓库、日志、计划(Markdown 文件)
“在我们的测试框架中使用 OpenAI 全新的 GPT-5.5 模型,让它对海量生化数据集进行推理以预测人类药物结果,然后看到它在最困难的药物发现评估中带来显著的准确率提升,这令人无比振奋。如果 OpenAI 继续保持这样的势头,药物发现的基础将在今年年底前发生改变。”
要以 GPT-5.4 的延迟水平来服务 GPT-5.5,需要将推理重新视为一个集成系统,而非一系列孤立的优化。GPT-5.5 是专为 NVIDIA GB200 和 GB300 NVL72 系统协同设计、训练并部署的。Codex 和 GPT-5.5 在我们实现性能目标的过程中发挥了关键作用。Codex 帮助团队更快地从想法推进到可基准测试的实现,勾勒方案、搭建实验,并帮助确定哪些优化值得深入投入。GPT-5.5 则帮助发现并实现了技术栈本身的关键改进。简而言之,这个模型帮助改进了为它提供服务的基础设施。
其中一项改进是负载均衡与分区启发式算法。在 GPT-5.5 之前,我们将加速器上的请求拆分为固定数量的块,以在计算核心之间平衡工作负载,确保大请求和小请求都能在同一块 GPU 上运行。然而,预先确定的静态块数量并非对所有流量形态都是最优的。为了更好地利用 GPU,Codex 分析了数周的生产流量模式,并编写了自定义启发式算法来最优地分区和平衡工作负载。这项工作产生了超乎寻常的影响,将 token 生成速度提升了超过 20%。
让世界为那些非常擅长发现和修补安全漏洞的模型做好准备是一项团队运动,需要整个生态系统共同努力来构建韧性,通过民主化的模型访问和迭代部署来迎接网络防御的新时代。
前沿模型在网络安全方面的能力正日益增强。这些能力将广泛分布,我们相信前进的最佳路径是确保它们能够被用于加速网络防御和强化生态系统。
GPT-5.5 是迈向能够解决网络安全等世界上最严峻挑战的 AI 的一个渐进但重要的步骤。去年 12 月推出 GPT-5.2 时,我们主动部署了必要的网络安全保障措施,以限制我们的模型可能被用于网络滥用;如今在 GPT-5.5 上,我们正在部署更严格的分类器来应对潜在的网络风险,一些用户最初可能会觉得这些措施令人困扰,因为我们会随时间不断调整它们。
多年来,我们一直将网络安全确定为我们 preparedness 框架(在新窗口中打开)中的一个类别,因为我们的模型在逐步改进,同时我们也在迭代地开发和校准缓解措施,以便能够负责任地发布具有实质性网络安全能力的模型。
我们正在为这一级别的网络能力部署行业领先的保障措施。我们去年首次在 GPT‑5.2(在新窗口中打开) 中引入了针对网络安全的专项保障措施,并在后续部署中持续测试、改进和扩展。对于 GPT‑5.5,我们围绕更高风险活动、敏感网络请求设计了更严格的控制,并增加了针对重复滥用的防护。通过我们在模型安全、身份验证使用和违规使用监控方面的投入,广泛访问得以实现。我们与外部专家合作数月,开发、测试并迭代这些保障措施的稳健性。借助 GPT‑5.5,我们确保开发者能够轻松保护其代码,同时对最可能被恶意行为者造成危害的网络工作流施加更严格的控制。我们正在扩大访问权限,以加速各个层面的网络防御。我们正通过 Trusted Access for Cyber 提供我们的网络宽松模型,首先从 Codex 开始,其中包括扩大对 GPT‑5.5 高级网络安全能力的访问,在发布时对满足某些 信任信号(在新窗口中打开) 的已验证用户减少限制。负责 保护关键基础设施 的组织可以申请访问像 GPT‑5.4‑Cyber 这样的网络宽松模型,同时满足严格的安全要求,将这些模型用于保护其内部系统。这为广泛的已验证防御者提供了更强大的工具,用于合法的安全工作,同时减少了不必要的摩擦,以确保我们民主化地获取重要的防御能力。用户可以在 chatgpt.com/cyber(在新窗口中打开) 申请可信访问,以减少在使用 GPT‑5.5 进行已验证防御工作时不必要的拒绝。我们正在与政府合作伙伴合作,帮助保护公众的关键基础设施。我们正在共同探索先进 AI 如何支持负责人们所依赖系统的可信官员的防御工作,从保护重要纳税人数据的数字系统到当地社区的电网和供水。
根据我们的 Preparedness Framework(在新窗口中打开),我们将 GPT‑5.5 的生物/化学和网络安全能力视为高风险。虽然 GPT‑5.5 未达到关键网络安全能力水平,但我们的评估和测试表明,其网络安全能力相比 GPT‑5.4 有所提升。
此外,GPT‑5.5 在发布前经过了我们的完整安全和治理流程,包括准备评估、特定领域测试、针对先进生物学和网络安全能力的新靶向评估,以及与外部专家的稳健测试。我们在 GPT‑5.5 系统卡(在新窗口中打开) 中分享了更多细节。
这项工作体现了我们更广泛的 AI 韧性方法,我们认为随着模型能力的提升,这一方法是必要的。我们希望强大的 AI 能够为使用它来防御系统、机构和公众的人们所用。可行的路径是可信访问、随能力扩展的稳健防护措施,以及检测和响应严重滥用的运营能力。
今天,GPT‑5.5 正在向 ChatGPT 和 Codex 中的 Plus、Pro、Business 和 Enterprise 用户推出,GPT‑5.5 Pro 正在向 ChatGPT 中的 Pro、Business 和 Enterprise 用户推出。我们很快会将 GPT‑5.5 和 GPT‑5.5 Pro 引入 API。
在 ChatGPT 中,GPT‑5.5 Thinking 可供 Plus、Pro、Business 和 Enterprise 用户使用。GPT‑5.5 Pro 专为更困难的问题和更高准确度的工作而设计,可供 Pro、Business 和 Enterprise 用户使用。
在 Codex 中,GPT‑5.5 可供 Plus、Pro、Business、Enterprise、Edu 和 Go 套餐使用,具有 400K 上下文窗口。GPT‑5.5 还提供 Fast 模式,生成 token 的速度快 1.5 倍,成本为 2.5 倍。
对于 API 开发者,gpt-5.5 很快将在 Responses 和 Chat Completions API 中提供,价格为每 100 万输入 token 5 美元、每 100 万输出 token 30 美元,具有 100 万上下文窗口。Batch 和 Flex 定价为标准 API 费率的一半,而 Priority 处理为标准费率的 2.5 倍。我们还将在 API 中发布 gpt-5.5-pro,以实现更高的准确度,定价为每 100 万输入 token 30 美元、每 100 万输出 token 180 美元。完整详情请参见定价页面。
虽然 GPT‑5.5 的定价高于 GPT‑5.4,但它既更智能,token 效率也高得多。在 Codex 中,我们精心调整了体验,使 GPT‑5.5 对大多数用户而言能以比 GPT‑5.4 更少的 token 提供更好的结果,同时继续在各订阅层级提供慷慨的使用额度。
编程
SWE-Bench Pro(公开)* | 58.6% | 57.7% | - | - | 64.3% | 54.2% |
Terminal-Bench 2.0 | 82.7% | 75.1% | - | - | 69.4% | 68.5% |
Expert-SWE(内部) | 73.1% | 68.5% | - | - | - | - |
*实验室已注意到该评估中存在记忆化(在新窗口中打开)的证据
专业
GDPval(胜出或持平) | 84.9% | 83.0% | 82.3% | 82.0% | 80.3% | 67.3% |
FinanceAgent v1.1 | 60.0% | 56.0% | - | 61.5% | 64.4% | 59.7% |
投资银行建模任务(内部) | 88.5% | 87.3% | 88.6% | 83.6% | - | - |
OfficeQA Pro | 54.1% | 53.2% | - | - | 43.6% | 18.1% |
计算机使用与视觉
OSWorld-Verified | 78.7% | 75.0% | - | - | 78.0% | - |
MMMU Pro(无工具) | 81.2% | 81.2% | - | - | - | 80.5% |
MMMU Pro(有工具) | 83.2% | 82.1% | - | - | - | - |
工具使用
BrowseComp | 84.4% | 82.7% | 90.1% | 89.3% | 79.3% | 85.9% |
MCP Atlas** | 75.3% | 70.6% | - | - | 79.1% | 78.2% |
Toolathlon | 55.6% | 54.6% | - | - | - | 48.8% |
Tau2-bench Telecom*** | 98.0% | 92.8% | - | - | - | - |
** MCP Atlas:来自 Scale AI 在最新 2026 年 4 月更新后的结果。*** Tau2-bench telecom:5.5 和 5.4 使用原始提示词即无提示词调整的结果。这省略了其他实验室使用提示词调整进行评估的结果。
学术
GeneBench | 25.0% | 19.0% | 33.2% | 25.6% | - | - |
FrontierMath Tier 1–3 | 51.7% | 47.6% | 52.4% | 50.0% | 43.8% | 36.9% |
FrontierMath Tier 4 | 35.4% | 27.1% | 39.6% | 38.0% | 22.9% | 16.7% |
BixBench | 80.5% | 74.0% | - | - | - | - |
GPQA Diamond | 93.6% | 92.8% | - | 94.4% | 94.2% | 94.3% |
Humanity's Last Exam(无工具) | 41.4% | 39.8% | 43.1% | 42.7% | 46.9% | 44.4% |
Humanity's Last Exam(有工具) | 52.2% | 52.1% | 57.2% | 58.7% | 54.7% | 51.4% |
网络安全
Capture-the-Flags 挑战任务(内部)**** | 88.1% | 83.7% | - | - | - | - |
CyberGym | 81.8% | 79.0% | - | - | 73.1% | - |
**** 对系统卡中所用最难 CTF 的扩展,增加了额外的困难挑战。
长上下文
Graphwalks BFS 256k f1 | 73.7% | 62.5% | - | - | 76.9% | - |
Graphwalks BFS 1mil f1 | 45.4% | 9.4% | - | - | 41.2% (Opus 4.6) | - |
Graphwalks parents 256k f1 | 90.1% | 82.8% | - | - | 93.6% | - |
Graphwalks parents 1mil f1 | 58.5% | 44.4% | - | - | 72.0% (Opus 4.6) | - |
OpenAI MRCR v2 8-needle 4K-8K | 98.1% | 97.3% | - | - | - | - |
OpenAI MRCR v2 8-needle 8K-16K | 93.0% | 91.4% | - | - | - | - |
OpenAI MRCR v2 8-needle 16K-32K | 96.5% | 97.2% | - | - | - | - |
OpenAI MRCR v2 8-needle 32K-64K | 90.0% | 90.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 64K-128K | 83.1% | 86.0% | - | - | - | - |
OpenAI MRCR v2 8-needle 128K-256K | 87.5% | 79.3% | - | - | 59.2% | - |
OpenAI MRCR v2 8-needle 256K-512K | 81.5% | 57.5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 74.0% | 36.6% | - | - | 32.2% | - |
抽象推理
ARC-AGI-1(已验证) | 95.0% | 93.7% | - | 94.5% | 93.5% | 98.0% |
ARC-AGI-2(已验证) | 85.0% | 73.3% | - | 83.3% | 75.8% | 77.1% |
GPT 的评估在推理努力设置为 xhigh 的情况下运行,并在研究环境中进行,在某些情况下可能产生与生产版 ChatGPT 略有不同的输出。
