返回 文章 apply CMS 文章

OpenAI 发布 GPT-5.4:面向专业工作的最强前沿模型

GPT-5.4 是 OpenAI 迄今最强大、最高效的前沿模型,首次为通用模型带来原生计算机使用能力,并在专业工作、编程和智能体任务上全面刷新基准。

GPT-5.4OpenAI前沿模型计算机使用
成长分 / 100 77 综合收获、行动、留存与影响

OpenAI 发布 GPT-5.4:面向专业工作的最强前沿模型
为什么值得读了解 GPT-5.4 在推理、编程、计算机使用和工具调用方面的具体能力提升与基准数据。

掌握 GPT-5.4 在 ChatGPT、API 和 Codex 中的可用性、定价与上下文窗口等关键部署信息。

关键洞察
  1. GPT-5.4 是 OpenAI 首个具备原生计算机使用能力的通用模型,在 OSWorld-Verified 上达到 75.0% 成功率,超过人类 72.4% 的表现。
  2. 在 GDPval 上,GPT-5.4 在 83.0% 的对比中达到或超过行业专业人士,而 GPT-5.2 为 70.9%。
  3. GPT-5.4 支持多达 100 万 token 的上下文,并通过工具搜索将 MCP Atlas 基准的 token 使用量减少 47% 且保持相同准确率。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:26104

今天,我们在 ChatGPT(作为 GPT‑5.4 Thinking)、API 和 Codex 中发布 GPT‑5.4。这是我们面向专业工作打造的最强大、最高效的前沿模型。我们还在 ChatGPT 和 API 中发布 GPT‑5.4 Pro,面向希望在复杂任务上获得极致性能的用户。

GPT‑5.4 将我们近期在推理、编程和智能体工作流方面的最佳进展整合到一个前沿模型中。它融合了 GPT‑5.3‑Codex 业界领先的编程能力,同时改进了模型在工具、软件环境以及涉及电子表格、演示文稿和文档的专业任务中的工作方式。最终成果是一个能够准确、有效且高效地完成复杂实际工作的模型——以更少的反复沟通交付你想要的结果。

在 ChatGPT 中,GPT‑5.4 Thinking 现在可以预先提供其思考计划,因此你可以在它工作期间于响应中途调整方向,并在无需额外轮次的情况下获得更贴合你需求的最终输出。GPT‑5.4 Thinking 还改进了深度网络研究,尤其是针对高度具体的查询,同时更好地保持上下文,以应对需要更长思考的问题。这些改进共同意味着更高质量的答案能够更快到达,并始终与手头任务保持相关。

在 Codex 和 API 中,GPT‑5.4 是我们发布的第一个具备原生、最先进计算机使用能力的通用模型,使智能体能够操作计算机并跨应用程序执行复杂工作流。它支持多达 100 万 token 的上下文,让智能体能够跨长周期规划、执行和验证任务。GPT‑5.4 还通过工具搜索改进了模型在大型工具和连接器生态系统中的工作方式,帮助智能体更高效地找到并使用合适的工具,而不会牺牲智能。最后,GPT‑5.4 是我们迄今 token 效率最高的推理模型,与 GPT‑5.2 相比,解决问题时使用的 token 显著更少——这意味着 token 用量降低、速度更快。

结合通用推理、编程和专业知识工作方面的进步,GPT‑5.4 在 ChatGPT、API 和 Codex 中实现了更可靠的智能体、更快的开发者工作流和更高质量的输出。

| |

GDPval(胜出或持平) | 83.0% | 70.9% | 70.9% |

SWE-Bench Pro(公开) | 57.7% | 56.8% | 55.6% |

OSWorld-Verified | 75.0% | 74.0%* | 47.3% |

Toolathlon | 54.6% | 51.9% | 46.3% |

BrowseComp | 82.7% | 77.3% | 65.8% |

*此前报告为 64.7%。GPT‑5.3‑Codex 通过新引入的 API 参数保留原始图像分辨率,达到 74.0%。

在 GPT‑5.2 的通用推理能力基础上,GPT‑5.4 在专业人士关心的真实世界任务上提供了更加一致且更精细的结果。

GDPval 上,该测试评估智能体在 44 种职业中产出规范明确的知识工作的能力,GPT‑5.4 达到了新的最先进水平,在 83.0% 的对比中达到或超过行业专业人士,而 GPT‑5.2 为 70.9%

在 GDPval 中,模型尝试完成明确规定的知识工作,涵盖对美国 GDP 贡献最大的 9 个行业中的 44 种职业。任务要求产出真实的工作产品,例如销售演示文稿、会计电子表格、紧急护理排班表、制造图表或短视频。GPT‑5.4 的推理强度设置为 xhigh,GPT‑5.2 设置为 heavy(在 ChatGPT 中略低一级)。

“GPT-5.4 是我们尝试过的最好的模型。它现在在我们 APEX-Agents 基准测试中位居榜首,该基准衡量模型在专业服务工作方面的表现。它擅长创建长周期交付物,如幻灯片、财务模型和法律分析,在提供顶级性能的同时,运行速度更快、成本低于竞争的前沿模型。”

我们特别注重提升 GPT‑5.4 创建和编辑电子表格、演示文稿和文档的能力。在一项初级投资银行分析师可能完成的电子表格建模任务的内部基准测试中,GPT‑5.4 的平均得分为 87.3%,而 GPT‑5.2 为 68.4%。在一组演示文稿评估提示中,人工评分者因 GPT‑5.4 的演示文稿具有更强的美感、更丰富的视觉多样性以及更有效地使用图像生成,而 68.0% 的情况下更偏好 GPT‑5.4 的演示文稿而非 GPT‑5.2 的。

GPT-5.2 与 GPT-5.4 电子表格输出并排示例

文档生成时推理强度设置为 xhigh

您可以在 ChatGPT 中使用 GPT‑5.4 Thinking 或 Pro 尝试这些功能。如果您是企业客户,我们建议使用我们新发布的 ChatGPT for Excel 加载项(在新窗口中打开),该加载项也于今日推出。我们还更新了 Codex 和 API 中可用的 电子表格(在新窗口中打开)演示文稿技能(在新窗口中打开)

为了让 GPT‑5.4 更好地完成现实世界的工作,我们继续在减少幻觉和错误方面取得进展。GPT‑5.4 是我们迄今为止最符合事实的模型:在一组用户标记了事实错误的去标识化提示中,相对于 GPT‑5.2,GPT‑5.4 的单个陈述为假的概率降低了 33%,其完整响应包含任何错误的概率降低了 18%。

“GPT-5.4 为文档繁重的法律工作设定了新标准。在我们的 BigLaw Bench 评估中,它得分 91%。与其他模型相比,GPT-5.4 目前在构建复杂的交易分析、在冗长合同中保持准确性以及提供法律从业者所需的高水平细节方面表现更佳。”

GPT‑5.4 是我们首个具有原生 计算机使用能力 的通用模型,标志着开发者和智能体 alike 的重大进步。它是目前可供开发者在网站和软件系统上构建完成真实任务的智能体的最佳模型。

我们设计 GPT‑5.4 时,力求其在广泛的计算机使用工作负载中表现出色。它非常擅长编写通过 Playwright 等库来操作计算机的代码,也擅长根据屏幕截图发出鼠标和键盘命令。其行为可通过开发者消息进行引导,这意味着开发者可以调整行为以适应特定用例。开发者甚至可以通过指定自定义确认策略,来配置模型的安全行为,以适应不同级别的风险容忍度。

该模型的性能和灵活性体现在测试不同设置下计算机使用的各项基准中。在 OSWorld-Verified 上,该基准衡量模型通过屏幕截图和键盘/鼠标操作导航桌面环境的能力,GPT‑5.4 达到了最先进的 75.0% 成功率,远超 GPT‑5.2 的 47.3%,并超过了人类 72.4% 的表现。1

WebArena-Verified 上,该基准测试浏览器使用,GPT‑5.4 在使用 DOM 驱动和屏幕截图驱动交互时达到了领先的 67.3% 成功率,相比之下 GPT‑5.2 为 65.4%。在同样测试浏览器使用的 Online-Mind2Web 上,GPT‑5.4 仅使用基于屏幕截图的观察就达到了 92.8% 的成功率,优于 ChatGPT Atlas 的 Agent Mode,后者的成功率为 70.9%

工具让出是指助手让出以等待工具响应。如果并行调用 3 个工具,随后又并行调用 3 个工具,则让出次数为 2。工具让出比工具调用更能反映延迟,因为它体现了并行化带来的好处。

GPT‑5.4 解读浏览器界面的屏幕截图,并通过基于坐标的点击与 UI 元素交互,以发送电子邮件和安排日历事件。视频未加速。

GPT‑5.4 改进的计算机使用能力建立在该模型改进的通用视觉感知能力之上。在 MMMU-Pro 上,该测试衡量模型的视觉理解与推理能力,GPT‑5.4 在不使用工具的情况下达到了 81.2% 的成功率,较 GPT‑5.2 的 79.5% 有所提升。改进的视觉感知也转化为更好的文档解析能力。在 OmniDocBench 上,GPT‑5.4 在未使用推理努力时达到了 0.109 的平均误差(通过模型预测与真实值之间的归一化编辑距离衡量),较 GPT‑5.2 的 0.140 有所改善。

MMMUPro 在推理努力设置为 xhigh 的情况下运行。OmniDocBench 在推理努力设置为 none 的情况下运行,以反映低成本、低延迟的性能。

我们还在改进对密集、高分辨率图像的视觉理解,在这些图像中完整保真度至关重要。从 GPT‑5.4 开始,我们引入 original

图像 输入细节(在新窗口中打开) 级别,支持最高 10.24M 总像素或 6000 像素最大维度(以较低者为准)的全保真感知;high

图像输入细节级别现在支持最高 2.56M 总像素或 2048 像素最大维度。在 API 用户的早期测试中,我们观察到使用 original

high

细节时,在定位能力、图像理解和点击准确性方面都有显著提升。

“在我们衡量约 3 万个 HOA 和房产税门户网站计算机使用性能的评估中,GPT-5.4 首次尝试成功率达到 95%,三次尝试内达到 100%,而此前的 CUA 模型约为 73–79%。它完成会话的速度还快了约 3 倍,同时使用的 token 减少了约 70%,在大规模应用中显著提升了可靠性和成本效率。”

在 API 中,开发者可以使用更新后的 computer

工具来访问这些能力。请参阅我们更新后的文档(在新窗口中打开)以了解推荐的最佳实践。

GPT‑5.4 将 GPT‑5.3‑Codex 的编码优势与领先的知识工作和计算机使用能力相结合,这些能力在长时间运行的任务中最为重要,因为模型可以在这些任务中使用工具、迭代,并在更少人工干预的情况下推进工作。它在 SWE-Bench Pro 上达到或超过 GPT‑5.3‑Codex,同时在各种推理强度下具有更低的延迟。

我们通过观察模型的生产行为并在离线环境中模拟来估算延迟。延迟估算考虑了工具调用时长(代码执行时间)、采样 token 和输入 token。现实世界中的延迟可能会有很大差异,并取决于我们的模拟未捕捉到的许多因素。推理强度从 none 到 xhigh 进行了全面测试。

开启后,Codex 中的 /fast 模式在 GPT‑5.4 下可提供最高 1.5 倍的 token 速度。它是同一个模型、同样的智能,只是更快。这意味着用户可以在保持心流的同时推进编码任务、迭代和调试。开发者可以通过使用优先处理(在新窗口中打开),经由 API 以同样快的速度访问 GPT‑5.4。

在评估和内部测试中,我们发现 GPT‑5.4 在复杂前端任务上表现出色,与我们此前发布的任何模型相比,结果在美观性和功能性上都有明显提升。

为了展示该模型改进后的计算机使用和编码能力协同工作,我们还发布了一项实验性的 Codex 技能,名为“Playwright(交互式)(在新窗口中打开)”。这使 Codex 能够对 Web 和 Electron 应用进行可视化调试;它甚至可以用于测试它正在构建的应用,在构建过程中同步测试。

使用 GPT‑5.4 根据一个仅轻度指定的提示制作的主题公园模拟游戏,使用 Playwright Interactive 进行浏览器游玩测试,并使用图像生成来制作等距视角素材集。该模拟包括基于地块的路径放置、游乐设施和景观建造、游客寻路、排队和游乐设施循环,而金钱、游客数量、幸福度、清洁度和评分等公园指标会根据布局表现以及游客的反应而上升或下降。Playwright 被用于自动化浏览器游玩测试,通过建造和扩展公园、放置和移除路径与景点、检查摄像机导航,并验证游客、队列、游乐设施状态和 UI 指标在数轮游玩中是否正确更新。

提示词:使用 $playwright-interactive 和 $imagegen。创建一个交互式等距视角主题公园模拟游戏,我可以在浏览器中搭建和游览。使用 imagegen 确立整体视觉愿景并生成游戏资产,包括游乐设施、道路、地形、树木、水体、食品摊位、装饰物、建筑、图标和 UI 插图。世界应当感觉统一、精致且视觉丰富,具备适合等距视角的高端美术方向。让我能够放置和移除道路、添加景点、摆放景观,并在公园中流畅移动,同时监控游客活动、游乐设施状态和公园发展。包含可信的游客移动、简单的公园管理系统(如金钱、清洁度、排队和幸福度),并让体验感觉有趣、清晰且完整,而不是像一个粗糙的原型。优先考虑魅力、可读性和强烈的游戏手感,而非写实。

在进行游戏测试时,务必通过多轮游玩来搭建和扩展公园,验证放置和导航是否流畅运行,确认游客会对公园布局和景点做出反应,并确保视觉、UI 和交互感觉稳定且统一。

“GPT-5.4 目前在我们内部基准测试中处于领先地位。我们的工程师发现它比之前的模型更自然、更果断。它能处理模糊问题而不会自我怀疑,并且会主动并行化工作以保持推进。”

借助 GPT‑5.4,我们显著改进了模型与外部工具的协作方式。智能体现在可以跨更大的工具生态系统运行,更可靠地选择正确的工具,并以更低的成本和延迟完成多步骤工作流。

在 API 中,GPT‑5.4 引入了工具搜索(在新窗口中打开),使模型在获得大量工具时能够高效工作。

此前,当模型获得工具时,所有工具定义都会预先包含在提示词中。对于拥有大量工具的系统,这可能会为每个请求增加数千甚至数万个 token,从而增加成本、拖慢响应,并用模型可能永远不会使用的信息挤占上下文。

借助工具搜索,GPT‑5.4 改为接收一份轻量的可用工具列表以及一项工具搜索能力。当模型需要使用某个工具时,它可以查找该工具的定义,并在那一刻将其追加到对话中。

这种方法大幅减少了工具密集型工作流所需的 token 数量,并保留了缓存,使请求更快、更便宜。它还使智能体能够可靠地与更大的工具生态系统协作。对于可能包含数万个 token 工具定义的 MCP 服务器,效率提升可能非常可观。

为展示效率提升,我们评估了 Scale 的 MCP Atlas(在新窗口中打开) 基准测试中的 250 项任务,在启用全部 36 个 MCP 服务器的两种模式下进行:(1) 在模型上下文中直接暴露每个 MCP 函数,以及 (2) 将所有 MCP 服务器置于工具搜索之后。工具搜索配置将总 token 使用量减少了 47%,同时达到了相同的准确率。

示例 token 计数来自对 MCP-Atlas 公开数据集中 250 项任务取平均值。

GPT‑5.4 还改进了工具调用,在推理过程中决定何时以及如何使用工具时更加准确高效,尤其是在 API 中。与 GPT‑5.2 相比,它在 Toolathlon 上以更少的轮次实现了更高的准确率,该基准测试衡量 AI 智能体使用真实世界工具和 API 完成多步骤任务的能力。例如,一个智能体需要阅读电子邮件、提取作业附件、上传它们、评分并在电子表格中记录结果。

工具让出(tool yield)是指助手让出以等待工具响应。如果并行调用 3 个工具,随后又并行调用 3 个工具,则让出次数为 2。工具让出比工具调用更能反映延迟,因为它体现了并行化带来的收益。

对于偏好推理强度 None 的延迟敏感用例,GPT‑5.4 在其前代基础上进一步改进。

*在 *τ2-bench(在新窗口中打开)中,模型必须使用工具完成客户服务任务,其中可能存在一个模拟用户,可以与世界状态进行通信并采取行动。推理强度设置为 None。

GPT‑5.4 在智能体网络搜索方面表现更好。在 BrowseComp 上——一项衡量 AI 智能体能否持续浏览网络以查找难以定位信息的指标——GPT‑5.4 比 GPT‑5.2 跃升了 17%abs,而 GPT‑5.4 Pro 创下了 89.3% 的新最高水平。

在实践中,这意味着 GPT‑5.4 Thinking 更擅长回答需要从网络上众多来源汇集信息的问题。它可以更持久地跨多轮搜索以识别最相关的来源,尤其是对于“大海捞针”式的问题,并将它们综合成一个清晰、推理充分的答案。

在 BrowseComp 中,我们使用了搜索黑名单,将包含基准答案的网站排除在评估之外,以防止污染并确保公平衡量性能。GPT‑5.4 的测量日期晚于 GPT‑5.2,因此分数反映了模型、我们的搜索系统以及互联网状态的变化。GPT‑5.4 使用更长、更新的黑名单进行了测试。模型使用 ChatGPT 搜索工具,这可能与 API 搜索存在细微差异。

“GPT-5.4 xhigh 是多步骤工具使用的新最高水平。Zapier 运行着业内一些最严格的工具使用基准测试,在数百个高级真实世界工作流中测试模型。GPT-5.4 完成了以往模型放弃的任务——是迄今为止最持久的模型。”

与 Codex 在开始工作时概述其方法类似,ChatGPT 中的 GPT‑5.4 Thinking 现在会为更长、更复杂的查询以一段前言概述其工作。你还可以在响应中途添加指令或调整其方向。这样可以更轻松地引导模型达到你想要的确切结果,而无需重新开始或需要多个额外轮次。此功能现已在 chatgpt.com(在新窗口中打开) 和 Android 应用上提供,即将登陆 iOS 应用。

该模型还可以在困难任务上思考更长时间,同时保持对对话中较早步骤更强的感知。这使它能够处理更长的工作流和更复杂的提示,同时在整个过程中保持答案连贯且相关。

此视频为演示目的已加速。

近几个月来,我们在为 GPT‑5.4 的部署做准备的同时,持续改进随 GPT‑5.3‑Codex 一同推出的安全防护措施。与 GPT‑5.3‑Codex 类似,我们依据《防范框架》将 GPT‑5.4 视为高网络能力模型,并按照系统卡(在新窗口打开)中记录的方式,为其部署相应的保护措施。这些措施包括扩展的网络安全的防护体系,涵盖监控系统、可信访问控制,以及针对零数据保留(ZDR)界面上客户的高风险请求的异步阻断,同时持续投入更广泛的安全生态建设。

由于网络安全能力本身具有双重用途,我们在部署时保持审慎态度,同时持续校准我们的政策与分类器。对于 ZDR 界面上的某些客户,请求级别的阻断仍是我们网络风险缓解体系的一部分;由于分类器仍在改进中,在我们持续完善这些防护措施的过程中,可能会出现一些误报。这些更新旨在改进防护措施在实际运行中的表现,包括减少不必要的拒绝和过度附加条件的回复,同时保留针对滥用的强有力保护。

我们持续推进关于思维链(CoT)可监控性的安全研究,以更好地理解模型的推理方式,并帮助检测潜在的不当行为。作为这项工作的一部分,我们推出了一项新的开源评估——CoT 可控性,用于衡量模型能否刻意混淆其推理以逃避监控。我们发现,GPT‑5.4 Thinking 控制其 CoT 的能力较低,这对安全性而言是一项积极特性,表明该模型缺乏隐藏其推理的能力,且 CoT 监控仍是一种有效的安全工具。

GPT‑5.4 今日起在 ChatGPT 和 Codex 中逐步推出。在 API 中,GPT‑5.4 现已作为 gpt-5.4 提供

。GPT‑5.4 Pro 也已在 API 中作为 gpt-5.4-pro 提供

,面向需要在最复杂任务上获得最大性能的开发者。

在 ChatGPT 中,GPT‑5.4 Thinking 今日起面向 ChatGPT Plus、Team 和 Pro 用户提供,取代 GPT‑5.2 Thinking。GPT‑5.2 Thinking 将在三个月内继续向付费用户提供,位于模型选择器的“旧版模型”部分,之后将于 2026 年 6 月 5 日退役。Enterprise 和 Edu 计划的用户可通过管理员设置启用早期访问。GPT‑5.4 Pro 面向 Pro 和 Enterprise 计划提供。ChatGPT 中 GPT‑5.4 Thinking 的上下文窗口(在新窗口打开)与 GPT‑5.2 Thinking 保持不变。

GPT‑5.4 是我们首个主线推理模型,融合了 GPT‑5.3‑codex 的前沿编程能力,并在 ChatGPT、API 和 Codex 中同步推出。我们将其命名为 GPT‑5.4,以体现这一跃升,并简化使用 Codex 时在模型之间的选择。随着时间推移,你可以预期我们的 Instant 模型和 Thinking 模型将以不同的速度演进。

Codex 中的 GPT‑5.4 包含对 1M 上下文窗口的实验性支持。开发者可通过配置 model_context_window

model_auto_compact_token_limit

进行尝试。超出标准 272K 上下文窗口的请求将按正常速率的 2 倍计入使用限额。

在 API 中,GPT‑5.4 的每 token 定价高于 GPT‑5.2,以反映其增强的能力,同时其更高的 token 效率有助于减少许多任务所需的 token 总数。Batch 和 Flex 定价为标准 API 费率的一半,而 Priority 处理则为标准 API 费率的两倍。

gpt-5.2 | $1.75 / M tokens | $0.175 / M tokens | $14 / M tokens |

gpt-5.4 | $2.50 / M tokens | $0.25 / M tokens | $15 / M tokens |

gpt-5.2-pro | $21 / M tokens | - | $168 / M tokens |

gpt-5.4-pro | $30 / M tokens | - | $180 / M tokens |

专业能力

GDPval | 83.0% | 82.0% | 70.9% | 70.9% | 74.1% |

FinanceAgent v1.1 | 56.0% | 61.5% | 54.0% | 59.5% | — |

投资银行建模任务(内部) | 87.3% | 83.6% | 79.3% | 68.4% | 71.7% |

OfficeQA | 68.1% | — | 65.1% | 63.1% | — |

编程

SWE-Bench Pro(公开) | 57.7% | — | 56.8% | 55.6% | — |

Terminal-Bench 2.0 | 75.1% | — | 77.3% | 62.2% | — |

计算机使用与视觉

OSWorld-Verified | 75.0% | — | 74.0% | 47.3% | — |

MMMU Pro(无工具) | 81.2% | — | — | 79.5% | — |

MMMU Pro(有工具) | 82.1% | — | — | 80.4% | — |

工具使用

BrowseComp | 82.7% | 89.3% | 77.3% | 65.8% | 77.9% |

MCP Atlas | 67.2% | — | — | 60.6% | — |

Toolathlon | 54.6% | — | 51.9% | 45.7% | — |

Tau2-bench Telecom | 98.9% | — | — | 98.7% | — |

学术

Frontier Science Research | 33.0% | 36.7% | — | 25.2% | — |

FrontierMath Tier 1–3 | 47.6% | 50.0% | — | 40.7% | — |

FrontierMath Tier 4 | 27.1% | 38.0% | — | 18.8% | 31.3% |

GPQA Diamond | 92.8% | 94.4% | 92.6% | 92.4% | 93.2% |

Humanity's Last Exam(无工具) | 39.8% | 42.7% | — | 34.5% | 36.6% |

Humanity's Last Exam(有工具) | 52.1% | 58.7% | — | 45.5% | 50.0% |

长上下文

Graphwalks BFS 0K–128K | 93.0% | — | — | 94.0% | — |

Graphwalks BFS 256K–1M | 21.4% | — | — | — | — |

Graphwalks parents 0–128K(准确率) | 89.8% | — | — | 89.0% | — |

Graphwalks parents 256K–1M(准确率) | 32.4% | — | — | — | — |

OpenAI MRCR v2 8-needle 4K–8K | 97.3% | — | — | 98.2% | — |

OpenAI MRCR v2 8-needle 8K–16K | 91.4% | — | — | 89.3% | — |

OpenAI MRCR v2 8-needle 16K–32K | 97.2% | — | — | 95.3% | — |

OpenAI MRCR v2 8-needle 32K–64K | 90.5% | — | — | 92.0% | — |

OpenAI MRCR v2 8-needle 64K–128K | 86.0% | — | — | 85.6% | — |

OpenAI MRCR v2 8-needle 128K–256K | 79.3% | — | — | 77.0% | — |

OpenAI MRCR v2 8-needle 256K–512K | 57.5% | — | — | — | — |

OpenAI MRCR v2 8-needle 512K–1M | 36.6% | — | — | — | — |

抽象推理

ARC-AGI-1(已验证) | 93.7% | 94.5% | — | 86.2% | 90.5% |

ARC-AGI-2(已验证) | 73.3% | 83.3% | — | 52.9% | 54.2%(高) |

无推理的评估

OmniDocBench(归一化编辑距离) | 0.109 | 0.140 | — |

Tau2-bench Telecom | 64.3% | 57.2% | 43.6% |

评估在推理努力设置为 xhigh 的情况下运行,除非另有说明。基准测试是在研究环境中进行的,在某些情况下,其输出可能与生产环境中的 ChatGPT 略有不同。

作者

脚注

1 人类表现报告于 OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments(在新窗口中打开)

继续阅读

查看全部