返回 文章 apply CMS 文章

GPT-6 Astra:面向工作的下一代智能模型

GPT-6 Astra 是 OpenAI 迄今最强、最对齐的模型,专为企业复杂工作打造,无需大量准备即可融入现有工作流。

GPT-6 AstraOpenAI企业AI计算机使用
成长分 / 100 83 综合收获、行动、留存与影响

GPT-6 Astra:面向工作的下一代智能模型
为什么值得读了解 OpenAI 最新旗舰模型 GPT-6 Astra 的核心能力与定位,把握 AI 在企业工作场景中的最新进展。

获取 Astra 在计算机使用、编码、安全对齐等方面的具体性能数据与成本效率信息,辅助技术选型与部署决策。

关键洞察
  1. Astra 在计算机使用、浏览、专业工作、软件工程、网络安全和科学方面均处于最先进水平,可在 ChatGPT Work 和 Codex 中通过人们日常使用的应用程序工作,即使这些应用没有 API。
  2. Astra 经过训练能以更少 token 和更少重试完成任务,降低每任务成本;定价为每百万输入 token 10 美元起,每百万输出 token 50 美元起。
  3. 在 Terminal-Bench 4.0 上 Astra 达到 57.9% 的新高,高于 GPT-5.6 Sol 的 37.3% 和 Claude Fable 5.1 的 55.8%,且每个任务的估计 API 成本分别约低 9% 和 63%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6842

GPT‑6 Astra:面向工作的下一代智能

我们能力最强的模型,为各类企业需要完成的工作而打造。

深海军蓝的星空,散布着白色和彩色的星星。

上周我们推出了 GPT‑6 Astra,这是全球最智能、最对齐的模型,现已在 ChatGPT Work、Codex 和 API 中提供。Astra 在计算机使用、浏览、专业工作、软件工程、网络安全和科学方面均处于最先进水平,因此团队能够以无与伦比的速度、准确性和判断力承担最严苛的专业工作。

全球最适合复杂工作的模型

大多数 AI 系统要求企业在交付价值之前先准备数据、重新设计工作流程并构建自定义集成。Astra 改变了这一点。在 ChatGPT Work 和 Codex 中,它可以编写代码,并通过人们日常使用的相同应用程序来工作——即使这些应用程序没有 API。这意味着企业可以从第一天起就在现有工作流程中运用 AI,无需大量准备或工程工作。

*Excel 竞赛:GPT‑6 Astra 可以使用计算机使用功能完成 Financial Modeling World Cup 挑战,速度约为获胜人类参赛者的四倍——帮助分析师减少构建模型的时间,将更多时间用于解读结果和做出决策。来自 2023 Microsoft Excel World Championship*(在新窗口中打开)

在推出后的最初几天内,我们已经看到客户将 Astra 投入使用,从优化 GPU 到发现财务报表中的差异,再到制作更符合品牌的演示文稿。

在 OpenAI,Astra 在发布前数周就在内部推广,因此我们亲眼看到了计算机使用等前沿能力如何改变我们的工作方式。我们的开发者和营销团队使用 Astra 和 Codex,将三小时的多机位素材制作成我们的 GPT‑6 Astra 开发者第一印象视频(在新窗口中打开),该视频在短短 4 天内已获得超过 55 万次观看。我们的工程团队使用 Astra 发现并解决了一个内存分配瓶颈,该瓶颈导致测试环境中的 Codex 会话缓慢。通过切换分配器,他们实现了轮次延迟降低 25 倍,峰值内存使用量增加约 30%。

Astra 还更擅长遵循公司的语气、模板和设计标准,因此首次结果就更接近团队可以直接使用的内容。

GPT‑6 Astra 仅使用 OpenAI 演示模板中的几张幻灯片,就创建了一个关于虚构模型 GPT‑Gaia 的幻灯片,全程把握了正确的语气和布局。这意味着您可以期待幻灯片符合您的业务标准格式。

每一美元带来更多有用工作

Astra 延续了我们提供极其高效模型的承诺,为客户带来每一美元更多有用工作。它经过训练,能够以更少的 token 和更少的重试完成任务,这意味着更少的返工和更低的每任务成本。借助 Astra,OpenAI 在专业工作和编码评估(包括 Terminal Bench 4.0 和 Artificial Analysis Intelligence Index)中占据了成本效率前沿的大部分。定价为每百万输入 token 10 美元起,每百万输出 token 50 美元起。

Terminal-Bench 4.0 在复杂的终端任务上测试智能体,包括软件工程、系统配置和数据分析。GPT‑6 Astra 以 57.9% 创下新高,相比之下 GPT‑5.6 Sol 为 37.3%2,Claude Fable 5.1 为 55.8%,每个任务的估计 API 成本分别约低 9% 和 63%。

为重要工作提供更多安全性与控制

让 AI 访问业务系统,需要对其行为方式抱有信心。有鉴于此,Astra 是我们迄今为止对齐程度最高的模型,对人类的意图和授权有更强的遵循。

在训练期间,我们在内部计算机使用安全基准上测试了 Astra,该基准以最棘手的业务场景来测试模型,例如泄露机密信息、过度广泛地共享仪表板或删除数据。在该评估中,Astra 产生意外结果的频率比 GPT‑5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。额外的确认与自动审查进一步提升了 GPT‑6 Astra 和 GPT‑5.6 Sol 的表现。

各组织还可以决定 Astra 的部署范围。新的企业管理员控制功能让他们能够限制对已批准网站和桌面应用程序的访问、管理上传和下载,并控制浏览历史记录。ChatGPT Work 和 Codex 还包含确认策略等保障措施,可要求在执行重要操作前获得批准,并对可能不安全或未经授权的工具调用进行自动审查。这些控制功能让团队可以从受限配置开始,并随时间推移扩大访问范围。

为进一步扩大访问,除 Astra 之外,我们还在 ChatGPT Desktop 中推出新的企业插件。这些插件由最新的浏览器使用能力驱动,来自 Oracle Analytics、Power BI(Microsoft Fabric 服务)、Navan 和 Avalara,让访问熟悉的企业应用程序变得更加容易。

Astra(在新窗口中打开)也是首个达到

在我们

关键网络安全能力阈值之下的模型。凭借这一增强的能力,我们

准备框架中针对滥用以及模型采取未经授权行为的情况

加强了防护(在新窗口中打开),包括训练 Astra 尊重安全与安保边界、提升其抵御绕过保障措施尝试的能力,并部署旨在阻止有害响应的自动检查。

符合条件的 API 客户可在受支持的端点上使用零数据保留,但须经批准。

立即开始使用 Astra

ChatGPT Work(在新窗口中打开)中试用 GPT‑6 Astra,或

,或通过

Codex(在新窗口中打开)将其构建到你自己的产品和工作流中。

API(在新窗口中打开)企业管理员可以根据其适用的费率卡和协议启用 Astra。企业访问在发布时默认关闭。