隆重推出 Claude Opus 5

Claude Opus 5 今日正式发布。它是一款深思熟虑且主动积极的模型,其智能水平接近 Claude Fable 5 的前沿水准,而价格仅为其一半。
在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评估中,Opus 5 创下了新的最优成绩,不过在网络安全任务上仍落后于 Mythos 5。
Opus 5 专为日常使用而设计:它的工作效率高于其他模型。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强大的模型。

性能与成本效益
Claude Opus 5 在与前代 Opus 4.8 相同的成本下,性能大幅提升。本节图表展示了性能如何随模型的努力程度(effort)设置而变化,客户可利用该设置来优化智能水平,或节省 token 以获得更快、更经济的结果。
Opus 5 在重要的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,在每任务成本更低的情况下,性能达到 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,该模型在最高努力程度下,性能与 Fable 5 的峰值得分相差不到 0.5%,但每任务成本仅为其一半;在 high、xhigh 和 max 努力程度下,它在给定成本下的性能也优于所有其他模型。

我们在知识工作和问题解决任务上也看到了类似的结果。例如:
- 在 ARC-AGI 3 上,这是一项要求模型解决新颖问题的评估,Opus 5 的得分是第二名模型的三倍。 - 在
Zapier AutomationBench 上,该评估衡量模型能否从头到尾完成业务任务,在每任务成本相同的情况下,Opus 5 的通过率约为第二名模型的 1.5 倍。即使在最低努力程度设置下,Opus 5 通过的任务数量也超过任何其他模型。 - 在
OSWorld 2.0 上,这是一项计算机使用基准测试,Opus 5 在任意给定成本下都优于所有其他模型,以略高于三分之一成本超越了 Fable 5 的最佳成绩。
在若干相关评估中,它也是我们最好且最具成本效益的模型:

对于科学研究而言,Opus 5 相比 Opus 4.8 有显著提升。在我们所有的生命科学评估中,它的表现都优于 Opus 4.8,这些评估涵盖结构生物学、有机化学和生物信息学等主题。其提升在有机化学任务上最为显著,例如从光谱数据推断分子结构(在我们的内部基准测试中,得分比 Opus 4.8 高 10.2 个百分点),以及在蛋白质相关任务上,例如预测蛋白质序列变异如何影响其功能(此处得分高出 7.7 个百分点)。
最后,Opus 5 能够生成强大得多的视觉输出:
此处。
使用 Claude Opus 5
Claude Opus 5 在验证自身工作并仔细迭代直至成功方面要强得多。在评估和早期访问测试中,我们和我们的用户发现了许多 Opus 5 展现自主性和彻底性的例子:
- 在一个 Frontier-Bench 任务中,Opus 5 拿到了一张机械零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这个任务中,模型被有意设置为无法直接 查看该图纸。Opus 5 的应对方式是编写自己的计算机视觉流水线,从原始像素中提取几何信息,然后重建出完整的机械零件。它反复成功做到了这一点;在相同设置下,没有任何竞争模型能在五次尝试后解决它。 - 面对一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。一个竞争模型只修复了表面症状(而非底层原因),然后报告该 bug 已解决。
- 一家交易公司的工程师使用 Opus 5 在一次会话中为一家新交易所构建了市场数据源。之前的模型完全无法完成这项任务,即使工程师提供了详尽的计划。由于找不到可用于验证的实时数据源,Opus 5 甚至构建了自己的测试框架,以检查其代码是否正确解析了该交易所的数据。
以下是我们早期访问客户关于使用 Opus 5 体验的更多报告:
在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本接近 Fable 级别的性能。在 Devin 中,它还在困难的调试和根因分析任务上展现出特别的优势。
Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能。在 CursorBench 上,它仅略低于 Fable 5,并具有许多相同的行为。我们很期待看到开发者如何在 Cursor 中使用它。
Claude Opus 5 登顶了 Zapier 的 AutomationBench 排行榜,且消耗的 token 并不比之前的 Claude 模型多。它拿到一份原始账户健康工作簿,并端到端地运行了完整的流失预防流程:标记高风险账户、通知正确的负责人,并为留存运营进行总结。之前的模型未能通过;Opus 5 达到了 100%。
在我们的基因组学分析工作中,Claude Opus 5 的行为比我们运行过的任何模型都更像一位谨慎的科学家。它会选用正确的统计检验来排除混杂因素,通过独立方法交叉核对自己的结果,并在漫长的多步骤分析中保持正轨。
Claude Opus 5 在我们的内部评估中超越了其家族中的每一个模型。它不仅在我们最困难的智能体编码任务上表现更好,比 Opus 4.7 提升了 22%,而且更稳定,每次运行之间的方差要小得多。对于 Lovable 上数百万的构建者来说,这种一致性就是全部。一次又一次构建,结果可靠。
Claude Opus 5 是自 4.5 以来 Opus 家族中最大的飞跃。在相同的全栈应用构建中,前端最先体现出来:这是我们见过的 Opus 模型中最出色的动画、游戏和 3D 作品。
我们非常喜欢 Claude Opus 5。对于我们的智能体所处理的那种开放式分析工作,它相比 Opus 4.8 是严格的升级,而且提升最大的地方恰恰是最重要的地方:更困难、更模糊的任务。回复更清晰、更简洁,我们也看到在更高努力水平下效率有所提升。
对于我们的分析师每天运行的金融研究工作流,Claude Opus 5 相比 Opus 4.8 是显著的改进。它在数值推理、表格工作以及精度至关重要的更敏锐批判性思维方面表现突出。
Claude Opus 5 提供了对专业企业内容分析至关重要的行业智能与准确性。Box 发现,Opus 5 比 Opus 4.8 的性能高出 8%,并在技术、医疗和公共部门组织日常依赖的数据分析(提升 11%)和尽职调查(提升 17%)工作流中带来了显著的性能提升。
Claude Opus 5 相较 Opus 4.8 是一次明显的代际跃升。在一个周末里,我让它担任我的开发环境的幕僚长角色:它构建了自己的监控程序,驱动了每一台机器,只在需要做判断时才把我拉进来。

Claude Opus 5 在我们的 Fundamental Research Assistant 代码库中进行了大规模修改,在整个智能体工作流中适应反馈,并比我们用过的任何模型都更清晰地解释其推理过程。它处理了我们通常会拆分成更小片段的工作。

在我们一些最困难的金融建模任务上,Claude Opus 5 在准确性和效率上都明显优于 Opus 4.8。它的性能下限实质性地更高,尤其是在深度金融领域逻辑方面。在各个努力级别上,它平均准确率高出 9 个百分点,同时轮次和工具调用减少了三分之一,时间减少了 60%。
Claude Opus 5 像一位真正的前端开发者那样检查自己的工作。在我们的基准测试中,它以桌面和手机宽度在浏览器中打开自己的页面,发现了隐藏在移动端折叠线以下的产品和屏幕外的结账按钮,并在交回工作之前修复了这两处问题。
与之前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上的性能明显提升,我们在公司治理和仲裁等实践领域看到了最大的收益。我们还对 Opus 5 在较低推理级别下保持质量的能力印象深刻,在平均生成 token 数比 Opus 4.8 在最大推理级别下少 26% 的同时,实现了相近的性能。
Claude Opus 5 对我们最大的收益在于更长周期的工作:构建完整的演示文稿,然后修改它。产出物的质量决定了我们发布哪个模型,而这是我们见过的最明显的提升——更好的视觉理解、更整洁的格式、更少的幻灯片问题。
Claude Opus 5 的判断力最为突出。在交接一个 PR 时,它不会急于发布:它会验证分支、检查模板,并思考测试影响,以便交接干净利落。较旧的模型往往急于推进,结果被我们的检查卡住。
在一次重新架构的会话中,Claude Opus 5 对我提出的一个设计提出了反对意见,而且在我坚持时它没有让步。相反,它准确解释了我的想法中有价值的部分,将其反对意见缩小到一个单一的设计问题,并提出了一个折中方案,保留了好的部分同时修复了缺陷。正是这种判断力让我们能够在更少监督的情况下信任它。
在首轮红线修改上,Claude Opus 5 在我们测试过的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论也更好:在保密协议上,它用更少的时间和更少的轮次就完成了红线修改,同时准确性保持或更好。
Claude Opus 5 编写干净、紧凑的 diff,没有死代码,并且在微妙的、代码库特定的问题上更擅长发现隐患。我们正在将其采用于生产工作负载。
我们肯定会在 Cosmos——我们的统一智能体平台——中迁移多个用例。我们期待越来越多地将 Claude Opus 5 用于代码审查,而且我可以自信地说,我们宁愿人们使用 Opus 5 而不是 Opus 4.8。

Claude Opus 5 最突出之处在于判断力。它在写下任何一行代码之前都会更深入地思考,在规划阶段就能发现自身的逻辑错误,而不是事后才发现,并且会推理一个答案为什么正确,而不仅仅是它是否可行。这是我们从一代 Claude 模型到下一代所见过的最明显的解题能力跃升,我们期待看到它在 JetBrains IDE 中被采用。
Claude Opus 5 是我们交易基准测试中测试过的最强 Opus 模型,而且它只用了大约七分之一的推理 token 和不到 Opus 4.8 一半的延迟就达到了这一水平。以极少的算力获得更好的答案。
Claude Opus 5 让监控智能体能够在生产环境中管理自己的部分记忆,使其在更长的时间跨度内更加自主和可靠。该智能体将其上下文视为一份活的文档:在标记出我们某项服务中的潜在异常后,它对照生产环境重新核验了自己的假设,发现该信号是良性的,将更正写入自己的记忆,并自行停用了其监控查询。
Claude Opus 5 是一个强大的智能体编程模型,专为长时间运行、多步骤的工作而构建。它深入理解你的代码库,在复杂任务中保持连贯,并且比 Opus 4.8 更有效地确定功能开发和缺陷修复的需求。开发者现在可以在 Kiro 中使用 Opus 5 进行构建,利用其高级能力来攻克雄心勃勃的项目。
对齐与安全
对齐。 在部署前测试期间,我们的自动化行为审计发现 Opus 5 是我们迄今为止对齐程度最高的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵守 Claude 的宪法;表现出最低的欺骗行为发生率;并且最不容易被诱骗而遭到滥用。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们迄今为止最安全的模型。

在我们的自动化行为审计中,Opus 5 在整体失准行为上得分为 2.3,是我们近期模型中最低的。
安全。 Opus 5 并未在具有风险的两用能力上推进前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和攻击性网络安全方面仍落后于 Mythos 5。有关这些评估的更多信息可在我们的系统卡中找到。
与其前代 Opus 4.8 一样,我们有意避免在网络任务上训练 Opus 5。尽管如此,由于整体能力变得更强,该模型在这些任务上已大幅提升,在发现网络安全漏洞方面已接近 Mythos 5。然而,在利用这些漏洞方面——也就是将漏洞转化为实质性网络威胁方面——它仍大幅落后于 Mythos 5。
这一点可由 Opus 5 在 OSS-Fuzz 上的表现加以说明。OSS-Fuzz 是我们开发的一项评估,用于衡量模型在缺乏大量人工指导的情况下,发现并进而利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞方面的成功率相近,但 Opus 5 在开发漏洞利用程序方面的得分远落后于 Mythos 5。

在 OSS-Fuzz(我们的网络安全评估之一)上,Opus 5 在识别软件漏洞方面接近 Mythos 5(左图),但在为其开发漏洞利用程序方面的成功率要低得多(右图)。
Opus 5 的防护措施
Claude Opus 5 的防护措施旨在允许该模型在网络安全和生物学领域发挥有益用途。这些措施与我们应用于 Opus 4.8 的防护措施类似,不同之处在于对一小部分网络任务施加了更强的护栏。
网络安全。 Opus 5 的网络分类器在限制程度上相应低于 Fable 5 上的分类器。它们允许 Opus 5 在源代码中查找漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关联的方法)、渗透测试以及漏洞利用程序生成。
根据我们的测试,我们预计这些分类器的干预频率将比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。在 API 上也可以启用回退到 Opus 4.8。
我们的网络验证计划(CVP)为原本会因模型防护措施而受阻的网络安全工作提供便利。已经加入 CVP 的企业和研究人员可立即访问安全限制更少的 Opus 5 版本。
生物学。 由于 Opus 5 拥有与 Opus 4.8 类似的一套防护措施,它现在是我们最具能力的、可普遍获取的科学研究模型。尽管如此,该模型在长时间运行的自主研究任务上仍表现出重要局限,而我们预计 AI 模型正是在这类任务上构成最重大的生物学相关风险。(对于这类生物学工作,Mythos 5 仍是更强的模型。)作为本次发布的一部分,在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5,而不是 Opus 4.8。
开始使用
Claude Opus 5 今日已在所有平台上线,定价为每百万输入 token 5 美元、每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始上手。
它还提供 Fast 模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,Fast 模式在 Claude Platform 上以 Opus 5 基础价格的两倍提供,并可通过 Claude Code 中的使用额度使用。
与 Opus 5 一同发布的还有两项测试版更新:
在对话过程中,开发者现在可以更改 Claude 可使用的工具,而不会使提示缓存失效。Claude 平台上的对话中途工具更改。用户现在可以选择让在 Opus 5(或 Fable 5)上被我们的安全分类器标记的请求自动路由到另一个模型。启用自动回退后,API 请求默认始终路由到最佳可用模型,而不是被阻止。API 上的自动回退。
与之前的 Opus 模型一致,Opus 5 对一般访问没有数据保留要求。
有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示指南。
相关内容
与我们的客户共同开发企业前沿保障措施
改进我们的对齐与安全工作
7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与 METR 合作进行独立审查。与此同时,我们分享过去一个月所做的一些更改。
预览模型硬件标准
我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。
