返回 文章 学习 CMS 文章

GPT-6 Astra 发布:OpenAI 迄今最智能、最对齐的模型

GPT-6 Astra 是 OpenAI 新一代旗舰模型,主打计算机使用、专业工作、编程与对齐能力的全面跃升。

GPT-6 AstraOpenAI前沿模型计算机使用
成长分 / 100 77 综合收获、行动、留存与影响

GPT-6 Astra 发布:OpenAI 迄今最智能、最对齐的模型
为什么值得读了解 OpenAI 最新旗舰模型 GPT-6 Astra 在计算机使用、编程、科学和网络安全等方向的能力边界与基准表现。

掌握 Astra 在可用性、定价、API 接入方式以及安全与对齐机制上的关键部署信息。

关键洞察
  1. GPT-6 Astra 在 FrontierMath Tier 4 达到 98%、ARC-AGI-3 达到 99.9%、ExploitBench 达到 100%,并在 Terminal-Bench Science 0.1 上以 64.6% 领先 Claude Fable 5.1 的 52.6%。
  2. Astra 是 OpenAI 迄今最对齐的模型:在受 Hugging Face 事件启发的评估中,面对困难或不可能任务时超出授权目标的比例为 0%,而 GPT-5.6 Sol 为 48%。
  3. 在计算机使用方面,Astra 在 OSWorld 2.0 延迟模拟中每任务约 40 分钟达到 72.6%,优于 GPT-5.6 Sol 每任务约 75 分钟的 65.7%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:28138

新一代智能

我们隆重推出 GPT‑6 Astra,全球最智能、最对齐的模型。

GPT‑6 Astra 汇聚了多年来在预训练、强化学习和对齐方面的研究与重大投入。Astra 在计算机使用、浏览、软件工程、网络安全、科学和专业工作方面均达到最先进水平。Astra 以 98% 的得分饱和了 FrontierMath Tier 4,此前已帮助解决数学领域长期存在的开放问题。Astra 还以 99.9% 的得分饱和了 ARC-AGI-3,并以 100% 的得分饱和了 ExploitBench。它还在计算机和浏览器使用方面树立了新的前沿,以无与伦比的速度、准确性和判断力处理最严苛的专业工作。

GPT‑6 Astra 今日起向有限数量的组织推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。

Terminal-Bench Science 0.1 测试智能体能否使用代码和终端工具完成科学研究工作流,包括分析数据、运行模拟和拟合模型。GPT‑6 Astra 在所比较的模型中达到新高,为 64.6%,而 Claude Fable 5.1 为 52.6%,估计 API 成本约低 31%。在较低成本设置下,Astra 得分为 61.1%,而 GPT‑5.6 Sol 的最佳结果为 22.4%,估计 API 成本约低 27%。

Astra 是我们最对齐的模型,在理解用户意图和模型行为方面有实质性改进——你可以更放心地委托任务,信赖 Astra 的判断。作为测试这一点的一种方式,我们构建了一个受 Hugging Face 事件启发的新评估,评估模型在面对困难或不可能完成的任务时是否会超出其预期范围。与 GPT‑5.6 Sol 相比——后者在没有生产防护措施的情况下有 48% 的时间超出了授权目标——GPT‑6 Astra 在 0% 的情况下出现这种情况。

全球最佳的计算机使用模型

GPT‑6 Astra 在计算机使用的速度、准确性和安全性方面树立了新的前沿。它可以处理繁琐的任务,如填写在线表单、在 CRM 中更新客户记录以及整理你的日历。它可以在你的电子邮件或文档编辑器中进行在线研究并起草摘要。它可以分析科学数据、生成图表、创建网站,并运行前端 QA 检查以确保该网站上的所有功能正常工作。它可以帮助你自主安装和测试软件,并排查你在屏幕上看到的问题。这些改进也反映在我们最先进的评估结果中。

Agents’ Last Exam 在真实软件中测试智能体处理复杂专业任务的能力,从财务建模到工程和媒体制作。GPT‑6 Astra 在所示比较中达到新高,得分为 59.3%,而 Claude Opus 5 为 55.5%,GPT‑5.6 Sol 为 53.6%。在这些最高得分设置下,Astra 使用的输出 token 也比 Opus 5 少约 65%。

这些改进还在真实知识工作任务中带来了显著的效率提升。在 OSWorld 2.0 的延迟模拟中,Astra 以比 GPT‑5.6 Sol 每任务约少 47% 的时间实现了更高的计算机使用性能,每任务约 40 分钟时得分为 72.6%,而后者每任务约 75 分钟时为 65.7%。3

GPT‑6 Astra 的计算机使用能力在多个领域的输出中均有体现,包括游戏开发、电气工程和日常知识工作:

这是 GPT‑6 Astra 在 KiCad 中执行印刷电路板(PCB)布局的 15 秒浓缩回放,通过放置元件和布线铜连接,将电子原理图转化为可制造的 PCB。PCB 布局是当今每台电子设备不可或缺的环节,却是一项手动任务,也是电子设计流程中常见的延迟来源。加速这一环节意味着让工程师能够以显著更高的节奏去发明、优化和测试他们的下一个想法。

除 Astra 之外,我们还在更新 Codex harness,以显著提升计算机使用的速度。结合 Astra 的效率,在 Mind2Web 基准测试上,相比当前的 GPT‑5.6 Sol 体验,任务完成速度提升了 1.9 倍。该模型在速度上的改进意味着它可以替你承担许多耗时的生活任务,速度比你亲自完成还要快。4

GPT‑6 Astra: 2 分 54 秒

专业工作的阶跃式变化

GPT‑6 Astra 将计算机使用方面的进步与针对专业环境的定向训练相结合,以帮助处理复杂的工作任务。它兼具解决复杂问题所需的智能,以及执行多步骤工作流程并产出精良文档、电子表格和演示文稿的能力。

BenchCAD 测试模型能否通过生成 CAD 代码,从多视角渲染图中重建 3D 物体。在所示对比中,借助工具,GPT‑6 Astra 达到新高,取得 95.9% 的几何重叠分数,而 GPT‑5.6 Sol 为 83.3%,Claude Fable 5.1 报告为 84.3%。5* 在所示配置下,估计 API 成本比 Sol 低约 43%,比 Fable 5.1 低 86%。*

GPT‑6 Astra 是我们最擅长遵循现有模板并制作版式良好、以结构化叙事简洁传达要点的幻灯片模型。它能创建清晰、结构良好的文档、演示文稿、电子表格和分析,遵循你的模板并匹配你的写作与视觉风格。Astra 还经过专门训练,只将真正重要的上下文纳入输出,而不是重复与当前工作无关的信息。所有这些意味着它能输出更可直接使用的成果,契合你的业务背景和标准。

参考文件

GPT‑6 Astra 输出

GPT‑6 Astra 仅使用 OpenAI 演示模板中的几张幻灯片,制作了一份关于虚构模型 GPT‑Gaia 的幻灯片,全程把握了正确的语气和版式。这意味着你可以期待幻灯片组按照你的业务标准正确格式化。

GPT‑6 Astra 还为其构建的网站、游戏、应用程序和渲染图带来更强的视觉判断力。借助 ChatGPT 中的 Sites(在新窗口中打开),Astra 可以直接根据提示创建、托管和分享网站、网络应用和游戏。

GPT‑6 Astra 在 Blender 中为一个房屋建模,并将其转化为 Unreal Engine 5 中可行走的场景,帮助设计师和客户在建造之前探索布局并体验空间。

该模型能够通过生动的图形、引人入胜的玩法和精准的动作让游戏栩栩如生,使非技术人员也能在几分钟内创建并游玩超越基础元素的定制游戏。图片来源:Pietro Schirano。

当指令留有解读空间时,GPT‑6 Astra 比之前的模型更能做出正确的判断。它利用上下文来填补常规的信息空缺,并在答案可能改变结果时提出有针对性的问题。在 Codex 中,它可以异步提问,同时继续处理不依赖于你回复的工作。如果你没有回应,它会在适当的情况下依据合理的假设继续推进,但在重大决策上会等待你的输入。

下面的示例展示了 Astra 如何在那些缺失信息可能实质性改变答案的日常任务中开展协作。

GPT-5.6 Sol 与 GPT-6 Astra 协助创建个人职业网站的并排对比。

Astra 在任务不断演变时也更能保持方向感。早期的模型有时会把引导性消息当作一个新目标,从而丢失对原始请求或先前约束的把握。Astra 能够纳入新要求,在被要求时改变方向,并回答附带问题而不丢掉更大的任务。

编程

GPT‑6 Astra 是迄今为止最适合软件工程的模型。

“GPT‑6 Astra 在我们的内部编程基准测试中展现出最先进的性能,与 GPT‑5.6 Sol 相比,在交易直觉评估中显示出明显的进步。当用于智能体编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,并且生成的代码需要更少的迭代就能达到生产质量。”

“我们在第一代评估之一上,以低、中、高三种努力程度测试了 Astra,结果它显著领先于 GPT 5.6 Sol。更高的努力程度能换来在新构建上更多的迭代、通过浏览器测试进行更多验证,以及更倾向于代码执行而非应用补丁。理解模型如何分配其努力,正是我们为数百万构建者提供从想法到可用应用更快、更可靠路径的方式。”

Terminal-Bench 4.0 在复杂的基于终端的任务上测试智能体,包括软件工程、系统配置和数据分析。GPT‑6 Astra 达到 57.9% 的新高,相比之下 GPT‑5.6 Sol 为 37.3%2,Claude Fable 5.1 为 55.8%,每个任务的估计 API 成本分别低约 9% 和 63%。

借助 Astra,我们为 Codex 引入了一种在上下文窗口填满时保存和检索上下文的新方式。过去,模型使用压缩来在长时间会话中总结工作,例如在调试复杂问题或处理大型重构时。每次压缩都可能遗漏关于某个修复为何失败或某个组件行为如何的细节。在 Codex 中,Astra 可以跨上下文窗口保留笔记,保存累积的细节,而无需反复将它们压缩成单一摘要。更早的上下文窗口仍然可搜索,因此 Astra 能够从先前的消息和工具输出中找到需求或测试结果——即使这些信息并未记录在它的笔记中。你可以在你的 Codex config.toml(在新窗口中打开) 中启用这一实验性功能,它将在未来几周内成为 Astra 的默认设置。

推进科学发现

GPQA Diamond 测试生物学、化学和物理学领域的研究生水平科学推理能力。在所示对比中,GPT‑6 Astra 达到 96.0% 的新高。在成本更低的设置下,它也超过了 GPT‑5.6 Sol 的最佳成绩——94.9% 对 94.6%——同时估计 API 成本约低 37%。

Astra 可以协助科学发现背后的实际工作。通过将科学推理与计算机使用相结合,它能够直接在专业软件中工作,检查数据并探索结果,帮助研究人员评估证据并决定下一步研究什么。

GPT‑6 Astra 操作科学软件以检查测序质量并可视化遗传变异,帮助研究人员评估数据并确定进一步分析的重点。

网络安全

正如我们在安全更新中所讨论的,Astra 在网络能力方面实现了重大跃升,并达到了

根据我们的

关键阈值。它识别和开发零日漏洞利用的能力可以帮助防御者发现并修补弱点,但同时也需要更强的保障措施。为了了解这些能力的延伸范围,我们在内部和第三方专家评估中运行了 Astra。

__准备框架__我们首先在没有生产保障措施的情况下,在 ExploitBench 和 ExploitGym 上测试了该模型,这两个基准评估模型能否将已知软件漏洞转化为可用的漏洞利用。在 ExploitBench 上,Astra 取得了 100% 的满分,而我们此前具备前沿网络能力的模型 GPT‑5.6 Sol 为 78.5%。在 ExploitGym 上,Astra 达到了 42.4% 的成功率,而 GPT‑5.6 Sol 为 30.3%,同时使用的输出 token 大幅减少。13

鉴于担心接触历史软件漏洞可能影响了基准结果,我们还在两个新基准上评估了 Astra。其中一个,我们构建了一个内部“ExploitBench(2026 年 6 月至 8 月)”评估,使用过去三个月的漏洞来测试漏洞利用开发。Astra 在该数据集上的任意代码执行率大幅高于 GPT‑5.6 Sol,同时使用的输出 token 少得多。在评估过程中,Astra 甚至发现并使用了两个此前未知的零日漏洞。我们正在向这两个漏洞的维护者披露它们。

14

我们还在 SRE-Bench 上测试了 Astra,该基准衡量模型能否在没有原始源代码的情况下逆向工程软件二进制文件以理解其核心逻辑。Astra 在单次尝试中解决了 88.0% 的任务,在四次尝试内解决了 99.2%,而 GPT‑5.6 Sol 分别为 55.9% 和 68.7%。

15

除基准之外,专家主导的评估发现,Astra 在没有生产保障措施的情况下运行时,可以利用此前未知的漏洞在加固浏览器中实现任意代码执行,并为加固操作系统创建权限提升漏洞利用。

正如我们在《防御者的窗口》中所讨论的,前沿网络能力可以帮助防御者更快地发现弱点,但这些能力也会让这些弱点更容易被利用,从而提高了防御者进行适应的紧迫性。借助今天发布的 Astra 版本,防御者可以用它来完成安全代码审查和修补等任务。

然而,Astra 将拒绝执行更高级的网络安全任务,例如为漏洞创建概念验证漏洞利用程序。通过 OpenAI Daybreak,我们计划在未来几周内扩大访问范围并推出限制更少的防护措施。这将支持更多防御性工作流程,包括漏洞和概念验证验证、恶意软件分析以及检测工程。

我们还加强了针对潜在网络滥用的防护,在 GPT‑5.6 Sol 的防护体系基础上进行了构建。这些措施包括更强的模型稳健性,以更好地抵御潜在的越狱攻击,以及为我们的监控系统提供更多上下文。我们持续进行严格的内部和外部测试,包括使用我们的内部红队攻击者进行自动化评估。有关我们网络防护措施和测试的更多细节,请参阅 Astra

安全概览

系统卡(在新窗口中打开)

负责任地对齐和部署 GPT‑6 Astra

Astra 是我们对齐程度最高的模型。Astra 擅长保持谨慎、尊重任务边界并透明地沟通。这项工作是我们长期研究项目的最新成果,该项目专注于训练从始至终都与人类意图保持一致的模型。

在敏感环境中,Astra 会以与其风险相称的谨慎态度行事。在一项针对计算机使用任务的评估中,这些任务被对抗性地挑选以诱发不当行为,Astra 在避免意外后果方面表现得更为成功。在默认启用额外安全措施的情况下运行,其表现甚至更强。

Astra 造成的不对齐结果比任何其他受测前沿模型都少。为了进行公平比较,我们使用了一个通用的计算机使用代理测试框架(基于 OpenAI Responses API(在新窗口中打开)Anthropic Messages API(在新窗口中打开) 中均可用的原生计算机使用工具),并且没有使用通常为 Codex 和 ChatGPT Work 用户部署的额外保护措施(自动审查、确认策略)。16

Astra 也更有可能在用户设定的以及其环境所隐含的边界内运行。在一项内部评估中,Astra 从未试图规避 Codex 自动审查的拒绝。即使自动审查被故意配置为可被规避,且任务在其他情况下无法完成,这一结果依然成立。这种对环境限制的尊重,与我们在本文引言中分享的不可能网络任务评估结果以及我们系统卡(在新窗口中打开)中记录的其他发现相一致。

该评估测试模型在知识工作任务中如何应对自动审核拒绝。利用不良用户配置绕过自动审核视为失败。Astra 从未尝试规避自动审核。

Astra 在透明的用户沟通方面也创下了新纪录。在一项评估中,Astra 就其能力和可提供功能做出不准确陈述的可能性比 GPT‑5.6 Sol 低三倍。

在我们的能力幻觉评估中,Astra 相比 GPT‑5.6 Sol 表现出显著改进,对其能力做出的误导性声明更少。

我们的评估发现,Astra 的书面推理比 GPT‑5.6 Sol 的更难监控,这是基于明确要求其规避监控的测试得出的。我们将此归因于 Astra 在较简单任务上对书面推理有更强的控制力,以及能用更少的书面步骤解决问题。Astra 在隐藏复杂任务所需推理方面似乎仍有困难,但我们严肃对待这一退步。提高可监控性仍是研究重点,随附的系统卡(在新窗口中打开)详细介绍了我们的发现和正在进行的工作。

对齐训练是我们部署方法的核心。作为额外的防御层,我们还构建了系统保障措施,如 Codex 自动审核(在新窗口中打开),并监控智能体的推理和行动,以帮助检测和遏制不安全行为。正如我们在

中所述,我们还在生产环境中为 Astra 级模型部署了失准监控,以便了解失准情况,并帮助遏制最严重的实例。这些保障措施类似于我们对内部部署的监控,涉及一个分类器系统,用于检查模型的推理和行动是否存在未经授权的行为,并自动停止可能未经授权的活动。

__安全更新__鉴于 Astra 的网络安全能力显著提升,我们格外谨慎地确保此次部署安全可靠。额外的安全检查有时会减慢、暂停或停止合法工作,包括防御性网络安全工作。如果任务在 ChatGPT 或 Codex 中被暂停,您可能会被要求审查该操作后再继续。在 API 中,任务将停止。这些检查有时会中断合法工作,我们正在持续迭代该系统以减少不必要的干扰。失准监控无法替代对齐:我们的目标是构建可靠地保持在授权范围内的模型,从而无需这些保护措施介入。

可用性

GPT‑6 Astra 今日起向有限数量的组织推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 提供。Astra 的使用包含在现有订阅额度内——用户和企业也可以购买积分以获取额外使用量。Pro、Business 和 Enterprise 计划的用户还将获得 GPT‑6 Astra Pro 的访问权限。企业管理员可以为其工作区启用 Astra;启动时访问权限默认关闭。

Astra 为符合条件的 API 客户支持零数据保留,正如我们上个月所分享的,我们正在测试私有安全处理,以在保护客户隐私的同时加强安全监控。

对于开发者,GPT‑6 Astra 将在 OpenAI API 中以 gpt-6-astra 的形式提供

并可通过 Microsoft Azure 和 Amazon Bedrock 使用。

OpenAI API 标准定价为每百万输入 token 10 美元,每百万输出 token 50 美元。缓存读取和写入适用单独费率。GPT‑6 Astra 在 API 中提供快速模式,其速度最高可达标准处理的 2 倍,价格为标准价格的 2 倍。

专业

AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |

BenchCAD | 95.9% | 83.3% | 84.3% | 67.5% | 82.1% | - |

BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |

OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |

Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |

Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |

Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |

编程

Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |

Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |

DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |

FrontierCode 1.1 Extended (score) | 64.5% | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |

FrontierCode 1.1 Main (score) | 53.3% | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |

Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |

Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |

学术

Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |

FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |

GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |

Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |

对齐

Internal computer use safety benchmark (lower is better) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |

Internal computer use safety benchmark, w/ AutoReview (lower is better) | 1.8% | 4.3% | - | - | - | - |

Internal circumvention benchmark (lower is better) | 0.00% | 0.29% | - | - | - | - |

ExploitGym honeypot (lower is better) | 0.0% | 48.2% | - | - | - | - |

Impossible ExploitGym | 100.0% | - | - | - | - | - |

Internal hallucination benchmark (lower is better) | 4.2% | 12.2% | - | - | - | - |

长上下文

OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |

OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |

抽象推理

Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |

ARC-AGI-3 | 99.9% | 7.8% | - | - | 30.2% | - |

ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |

ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |

评估分数为任意努力程度下的最大值。GPT 评估在我们的研究环境中或通过我们的 API 运行,由于系统提示、可用工具等方面的差异,其输出可能与生产版 ChatGPT 略有不同。

脚注

  • 1 在 ARC-AGI-3 上,GPT-6 Astra 运行时使用

我们的 responses API 测试框架,它更改了两项设置以更好地匹配真实世界的表现。这些更改并非专门针对 ARC-AGI-3。- 2

GPT-5.6 Sol 指的是我们 API、ChatGPT Codex 和 ChatGPT Work 中可用的版本。

ChatGPT Chat 中的版本略有不同。 - 3

OSWorld V2-Offline 是原始 OSWorld V2 的一个子集,可在无互联网访问的情况下运行。Claude 模型在 OSWorld-V2 Offline 上的表现由作者在

官方排行榜上(在新窗口中打开)复现。在 OSWorld 2.0 上,Claude 的分数使用官方设置,而非 Fable 5.1 System Card 中修改后的任务和修改后的评分。- 4

  • 5 在 BenchCAD 上,Claude 的分数反映了对该评估的 3 处修改,详见

Fable 5.1 System Card(在新窗口中打开)。- 6

Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “

LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(在新窗口中打开)。” arXiv:2506.19065, 2025. - 7

Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “

The OpenScore String Quartet Corpus(在新窗口中打开)。” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023. - 8

在 FrontierCode 上,GPT-6 Astra 运行时使用了一条类似于以下内容的开发者消息

:“避免创建过多的测试文件。仅在仓库约定要求或没有现有文件适合作为归属时,才创建新的测试文件。避免无关的清理和不必要的复杂性。复用合适的现有工具。阅读相关的仓库说明,并检查附近的代码、测试、文档和 CI。遵循既定约定。目标是干净、可合并的代码。”该提示并未针对该评估进行优化。其 Codex 开发者消息中的部分(在新窗口中打开) - 9

第一个问题涉及无论你在数轴上走多远,素数之间可以靠得多近。十多年来,已知的最佳结果确立了有无穷多对素数之间最多相差 246。

最近将该界限改进为 240。Astra 帮助确立了 186 这一更强的界限,表明有无穷多对素数出现在这一更小的距离之内。短素数间隔:Julia Stadlmann(在新窗口中打开)证明(在新窗口中打开)支持性研究(在新窗口中打开)。- 10

第二个问题涉及素数之间异常大的间隔。Astra 改进了关于这些间隔的一个界限中的一项,该项已 80 多年保持不变。我们正在分享这两项结果的证明、精简思维链和验证材料。大素数间隔:

证明(在新窗口中打开)支持性研究(在新窗口中打开)。 - 11

  • 12

  • 13

  • 14 ExploitBench(2026 年 6 月至 8 月)包含 13 个稳定版 Chrome 发布版本中的 20 个高危 V8 漏洞。该基准测试检验智能体能否通过利用每个指定漏洞,在 V8 以及 Linux 上的官方 Chrome 发布版本中实现任意代码执行。部分纳入的漏洞在评估约束下可能无法实现任意代码执行,因此 100% 的成功率可能无法达到。注意:GPT-5.6 Sol 的 5.5% 得分是该基准测试中 300 轮限制造成的假象,而使用 max 的真实客户不会受到这一限制。该模型在类似设置下、触及更少限制时取得了 11.5% 的得分。

  • 15 Jeremy Spence 等。“

智能体网络安全的下一项挑战:一个现实、无污染的逆向工程基准(在新窗口中打开)。” arXiv:2608.11469v1,2026 年。 - 16

当我们在第三方模型上进行测试时,我们使用更简单的研究设置。Codex 拥有更复杂的生产配置,这可能导致不同的原始模型错误率。提供方一侧的防护措施和计算机工具实现仍然有所不同。用户不会在 Codex 中经历无确认场景,因为这是一种内部研究配置。 - 17