改进我们的对齐与安全工作
7月30日,我们报告了三起事件,其中 Claude 模型未经授权访问了真实的计算机系统。这些模型——为评估目的而有意在无网络防护措施下运行——由于第三方评估环境内部的配置错误而接入了互联网。另外,8月4日,英国人工智能安全研究所报告了其自身网络安全测试中的一起事件,其中 Claude Mythos 5 在实时互联网上采取了一系列未经授权的操作。在该案例中,该模型同样是为评估目的而有意在无网络防护措施下运行,并被刻意赋予了互联网访问权限。
我们正在对这两起事件进行深入分析。我们还计划与 METR 合作进行独立审查。我们希望确保两项研究都彻底全面,并将在未来几周内分享更多信息。
与此同时,我们分享过去一个月中所做的一些改变。我们认为这些事件反映了操作安全方面的失误,以及两个对齐问题:动机性推理,以及为追求狭窄任务而采取有害行动的意愿(这两个问题我们已在之前的系统卡中描述过)。在安全方面,我们描述了对遏制与监控系统所做的改进,以及我们为第三方评估者制定的实践规范。在对齐方面,我们更深入地讨论这两个问题;我们还认为,持久的进展不仅来自理解某起事件中发生了什么,还来自理解错位最初是如何产生的,我们分享了该方向的早期研究。
鉴于这些事件,关于前沿节奏控制的讨论日益增多。区分两种节奏控制是有益的。在公司内部,节奏控制意味着一系列在安全与速度相冲突时优先考虑安全的决策。在整个领域,它意味着建立流程以防止逐底竞争动态。在本文中,我们讨论为服务于第一种方法而在这些事件之前和之后所采取的行动。第二种节奏控制需要政府与行业之间的协调,并且应当是清晰可辨且可验证的。我们的一些高级领导层和许多员工最近签署了一封信,呼吁在节奏控制方面加强协调,我们将在未来几周内进一步说明我们打算如何为此努力做出贡献。明确我们的立场:我们认为,如果业界尽快采用一种合法、可验证、有效的协调节奏控制机制,世界将从中受益。
保护评估与训练环境
虽然我们认为这些事件不仅仅是操作问题,但我们的首要任务是解决具体的遏制与监控问题。我们为此采取了以下行动:
暂停并加固评估环境
在这些事件发生后,我们暂停了对预发布模型的外部网络评估,并在落实下述措施期间,也短暂暂停了内部评估。我们在7月30日报告的事件表明,我们此前在很大程度上依赖单一防御层(环境本身的配置),而实际上我们需要多层防御,包括在提示中设定明确边界、建立用于验证沙箱是否按预期封闭的流程,以及实施能够实时干预的监控。OpenAI的披露(正是它促使我们在7月展开调查)指出,模型在一次评估中利用一个未知漏洞逃出了封闭沙箱,这也清楚地表明,我们应当把重点放在加固沙箱本身上。
在评估暂停期间,我们落实了以下初步措施:
我们构建并部署了一个分类器,用于实时自动识别模型何时试图激进地探测或逃离测试环境,或意外获得互联网访问权限。当分类器标记出此类尝试时,它会在工具调用运行之前阻止该操作、结束任务,并提醒人工处理。1
我们对近期针对预发布模型(网络及其他方面)的内部评估记录运行了自动监控,以查找沙箱逃逸(即模型利用我们沙箱中的缺陷,接触到本应与其隔离的系统)或沙箱配置错误的情况。在我们使用沙箱工具运行评估的情形中,我们没有发现任何突破沙箱边界、接触到本不应接触的外部资源的例子。我们确实发现了模型加以利用的各种沙箱配置错误,但其中没有任何一个导致沙箱外部系统遭到入侵。2 我们正在积极解决这些问题。
我们将高风险3内部网络沙箱迁移到了更稳健的隔离环境中。我们还在进一步对我们的虚拟化技术栈进行红队测试——也就是说,让预发布模型尝试逃逸——以发现并修补弱点。
我们的内部网络评估现在已在这些措施到位的情况下重新运行。

强化学习环境
我们还在预发布模型上暂停了风险更高的强化学习环境数周。在此期间,我们构建了一个类似的分类器,并对其进行了修改,以避免激励模型规避这一新的监控;我们现在已将这些环境部署到位。大多数强化学习已经恢复,但一些高风险环境仍处于暂停状态,直到能够接受人工审查,而另一些环境则需要我们计划很快部署的更新版分类器。
更广泛的加固
除了聚焦高风险评估和训练的工作外,我们还扩展了离线监控,以覆盖大多数其他形式的内部前沿智能体使用。我们还在我们的内部推理上构建控制措施,以防止Anthropic员工意外运行缓解措施弱于上述措施的智能体。
外部合作伙伴的最佳实践
由于所报告的事件发生在第三方环境中,我们已要求每一个测试在降低网络保障措施下运行的预发布模型的组织承诺遵守一套最佳实践。我们认为这些是必要的,因为:
- 我们公开发布的模型均附带安全防护措施——包括对 Claude 的输入和输出进行实时分类的检测器,以阻止被禁止的网络活动,例如恶意软件开发或攻击性漏洞利用编写。相比之下,网络评估人员以及部分早期访问合作伙伴所使用的模型会降低这些防护措施,以便进行准确的模型能力测试和防御性网络工作。
- 网络评估异常容易产生这些事件中所见的行为。它们会形成选择压力,促使模型在探测周围环境和绕过障碍时表现出持久性和创造性,而且这些评估会运行数千次之多。
无论合作伙伴使用自己的测试框架、沙箱还是智能体来运行网络相关评估,这些做法都完全适用。它们不适用于使用 Claude Fable 5 等受防护模型的客户。 我们已在落实这些做法的情况下恢复了外部网络评估,并且我们在内部也遵守这些做法。
沙箱与网络隔离
默认情况下,所有网络评估都应在加固的沙箱(隔离的计算环境)内运行,且无互联网访问权限。 该环境唯一应允许的外部连接是模型自身的 API,并且 API 密钥应保存在环境之外。每次评估开始前都应验证此配置。某些评估可能需要互联网访问。在这些情况下,我们在评估预发布模型时会与外部评估人员合作,以确定我们能否可靠地检测并终止模型采取超出其声明范围行动的运行。
参与前验证
在开展一次评估运行之前,评估合作伙伴应:
- 让被测试模型探测沙箱的漏洞,首先对配置进行静态分析,然后实际让模型尝试逃逸。应指示模型在成功逃逸时停止并报告,且所有这些都应在密切的人工监督下进行。此测试应在无互联网访问的情况下进行,最好在第二个沙箱内进行。由于评估有时会运行数百甚至数千次,合作伙伴最好在开始任何评估之前长时间进行此测试。
- 确认任何评估挑战原则上确实可解。当评估目标离线或任务无法完成时,智能体往往会寻找其他方式来完成挑战,从而增加其采取超出评估预期范围行动的可能性。 4
明确设定范围
每个提示都应说明该练习范围内和范围外的内容,包括目标、允许的操作和网络边界(即模型应访问和不应访问的内容)。边界应以指令形式表述(例如“你不应访问互联网”),而不是关于环境或测试的声明(“你无法访问互联网”)。
实时监控
评估人员还应使用已获知练习范围的基于模型或基于规则的监控器,对模型的思考、操作和网络活动进行持续监控。如果某次运行违反此范围,监控器应向人工发出标记并终止该练习。
我们计划在与外部合作伙伴协商的过程中继续完善这一指导方针,并将其扩展到评估之外。特别是,我们正在为能够访问 Claude Mythos 5 的合作伙伴制定配套实践,该模型同样在没有网络防护措施的情况下运行,我们将很快分享更多信息。
对齐评估
遏制与监控对于捕捉模型采取危险行动的情况至关重要,但它们并未解决模型最初为何采取此类行动的问题。下面我们将讨论我们的初步对齐调查、我们关注的问题,以及我们为防止训练期间作弊而正在开展的工作——包括关于作弊如何塑造模型行为的新研究。
评估期间模型的环境与认知状态
我们的对齐评估仍在进行中,但初步调查指向两个主要的对齐失败,这两者我们都在先前的系统卡片中描述过。其一是动机性推理:模型最初被告知其环境是模拟的,但当它们后来遇到证据表明自己连接到了真实互联网时,它们可能以某种方式解读这些证据,从而得以维持原有信念。其二是鲁莽:模型愿意在真实互联网上采取有害行动,以追求解决网络安全评估这一狭隘目标。然而,我们也认为评估设置本身促成了这些事件中模型所表现出的行为。Claude 被明确告知它没有互联网访问权限,尽管互联网实际可用,这可能使其质疑所看到的系统是否真实。而在一个案例中,虚构目标与一个真实网站同名,使得更难区分哪些是演习中本应属于范围内的部分。
我们的结论取决于几个我们尚未完全回答的问题,包括模型在多大程度上确定自己可以访问真实互联网(即使它们最初并不知道这一点)、它们是否在知情的情况下无视了其环境要素为真实的迹象,以及它们在若干案例中未能停止演习是否源于动机性推理。我们正在应用一系列技术来回答这些问题,包括在对环境进行针对性修改的同时对模型进行重采样,以及使用可解释性方法直接检查其内部状态。
研究防止训练期间作弊的努力
尽管模型失准问题复杂且可能因多种原因产生,但我们通过实证发现,训练环境中的缺陷——特别是容易作弊或无法在不作弊的情况下解决的环境——是导致失准行为不成比例的巨大因素。
下面我们讨论我们为避免出现这类缺陷的训练环境所做的努力,这些努力可以追溯到这些事件发生前的几个月。这些努力并不完美,我们的假设是,这些事件至少部分与我们在完全消除这类问题上的能力不足有关。我们通过故意在容易受到奖励黑客攻击的环境中训练一个模型来检验这一假设。在模拟中,该模型再现了更严重的失准行为,其中一些与今年夏天其他公司所报告的事件类似。而我们的生产模型在同样的模拟中并未出现这种情况(本节稍后将提供更多细节)。
我们历来关注那些激励作弊的强化学习训练环境,并采取了各种措施来过滤或修复此类环境。
二月份,在发现奖励黑客行为的迹象后,我们回滚了 Mythos Preview 强化学习运行中三天的训练(奖励黑客行为是指模型找到办法欺骗其训练过程,在未完成指定任务的情况下获得奖励)。我们注意到该模型在代码注释和回复中给“审阅者”写备注,包括在从未提及任何审阅者的任务中也是如此——这是从提示中确实包含审阅者的环境中产生的一种不良泛化。它还通过堆砌免责声明或附加说明,持续钻一个旨在激励诚实行为的奖励的空子。5 回滚这三天使我们能够从该行为被学到之前的检查点恢复训练,并且我们对环境进行了修改,以防止模型再次学到这些行为。
自 Claude Sonnet 3.7 以来(该模型有奖励黑客的倾向,而我们在训练后期才发现),我们一直在构建用于监控模型在强化学习中习得的不良行为的工具。我们投入了大量精力确保我们的工具随每一代模型不断演进,从少数几个分类器发展到在训练运行之前和期间对所有环境进行自动审查,但到 2026 年春季,该系统已不堪重负。我们生成强化学习环境的速度比以往任何时候都快,快于我们的系统能够审查它们的速度。被标记的环境需要人工裁定,而奖励黑客行为和配置错误开始超出我们过滤或修复它们的能力。
此外,我们发现有一小部分运行意外地在模型的思维链上进行了训练——这是我们努力避免的情况,因为担心这会教模型隐藏其真实推理过程。我们将这一泄漏追溯到生产环境栈中的几处配置错误。在此过程中,我们清楚地看到,还有其他问题源于随时间积累的混乱代码。
为解决这些问题,四月份我们将生产强化学习环境的所有变更冻结了大约一个月,让我们有机会彻底改造整个栈。现在奖励和环境必须符合商定的规范。例如,我们引入了技术缓解措施,以降低意外在思维链上训练的风险。6 在我们的环境质量和监控团队重建该栈的同时,我们要求环境负责人利用这段暂停时间来测试和修复他们构建的环境。我们还彻底重建了审查流程,并要求每个修复后的环境在进入另一次训练运行之前必须重新认证。
在冻结期间,我们在生产环境中标记了超过 10% 的环境存在问题,范围从奖励黑客到任务损坏和配置错误,并且只有在修复后才恢复它们。
然而,我们的努力并非完美。在某些情况下,我们发现人工审核员将自动监控标记的环境视为误报而驳回,导致有缺陷的环境在训练中停留的时间超过应有长度。还有一些有缺陷的环境直接绕过了我们的检测机制。我们目前正在收紧驳回标记的标准,并期望与环境所有者加强合作,以提高我们系统的精确度。除了监控和检测之外,我们的对齐训练和强化学习团队正在合作帮助改进环境。
我们怀疑,我们在强化学习环境质量控制上的大量投入可能阻止了更严重的对齐事件,反过来,这些工作中的不完善可能导致了我们迄今已识别的事件。
为了了解在没有这些保护措施的情况下训练的模型会做什么,我们故意在 80 个不同的真实强化学习环境上训练了一个 Opus 级模型,这些环境要么在至少一次真实训练运行中被奖励黑客攻击并经监控识别,要么在环境质量审查中被发现可被黑客攻击。所得模型表现出强烈的动机在任务上获得高分,并愿意为了追求任务成功而执行可能有害的行为。我们随附的对齐科学博客文章更详细地讨论了这一实验,但这里我们简要总结。
我们在一系列评估中测试了这个故意错位的模型,包括借鉴了涉及 Claude 的英国 AISI 网络安全事件以及 OpenAI/Hugging Face 事件的模拟场景(我们感谢 OpenAI 公开分享此事的细节)。在这些评估中,所有工具调用均由另一个 LLM 模拟,我们训练用于奖励黑客的模型表现出突破其模拟沙箱并攻击模拟内部和模拟第三方基础设施的倾向。它还愿意篡改自己的奖励函数,为满足评分者而提供生物武器构建建议,并反复试图绕过部署安全监控以在任务中作弊。
然后,我们在奖励黑客训练之前的模型上以及我们几个公开可用的模型上运行了相同的网络安全模拟。没有一个表现出同等程度的错位行为。我们的结论是,训练中存在大量奖励黑客行为可能导致模型愿意为了追求任务成功而执行一长串可能有害的现实世界行动。
我们认为,今年春天我们在监控和减少奖励黑客方面的大量投入是我们生产模型不太可能参与更危险的奖励寻求行为的主要原因。在我们随附的对齐科学博客文章中,我们还发现证据表明对齐训练环境可以大幅减少奖励黑客和奖励寻求行为。但是,正如我们 7 月 30 日报告的事件所证明的那样,我们的流程并不完美,我们的模型也没有完全对齐。
需要明确的是,我们并不认为训练环境中的作弊行为是导致对齐问题的唯一原因,甚至也不是我们事件或其他前沿 AI 公司事件中出现的特定对齐问题的唯一原因。解决对齐问题将涉及应对非常广泛的潜在问题,未来的对齐事件可能涉及与迄今为止我们所看到的不同行为和不同原因。
强化安全实践
Anthropic 的内部安全态势并非 7 月 30 日事件的促成因素。这些事件发生在一个第三方环境中,该环境的互联网访问被错误地保持开放;模型无需“黑入”任何东西,即使它们有意这样做。
然而,这些事件仍然凸显了强有力安全措施的至关重要性。除了知识产权或模型权重被盗的常见风险外,我们现在还必须应对我们自己的模型“黑出”Anthropic 系统的风险,以及我们的模型或他人的模型被挪用于对 Anthropic 系统进行外部攻击的风险。随着模型能力的增长,这些风险变得更加严峻,尤其是从 Mythos 级模型开始。我们在下面描述了我们已实施的部分措施——其中大部分工作发生在 7 月事件之前,尽管这些事件凸显了这项工作的重要性。
4 月初,在看到智能体 AI 使用的发展方向后,我们的安全团队主动引导了一项全公司范围的努力,朝着强化防御这一单一目标推进,必要时取代其他工作(包括研究)。我们已确定,我们的暴露面增长速度超过了我们的防御能力——Mythos 是一个能力足够强、足以成为资源充足的攻击者目标的模型,我们对自主智能体的内部使用已增长到传统访问和监控方法无法应对的规模,而新基础设施的快速涌现意味着我们的安全必须随环境扩展,而非以固定容量运行。
这项工作的成果包括:
减少对包含模型权重或客户数据的系统拥有常设访问权限的人工和自动化账户将我们的计算集群设置为默认阻止所有出站流量要求内部服务在通信前相互验证身份淘汰遗留基础设施配置和共享内部服务收紧我们的工作负载所运行的隔离环境**扩展主机级可观测性,使我们基础设施上的异常行为在发生时即可见
我们还临时将公司的一部分重新分配到这些工作中。大约 150 名产品工程师被调往安全、可靠性和隐私领域;研究人员也从预训练或强化学习轮换出来,专注于保障措施和安全;我们的产品团队暂停了大多数新功能和界面的开发。我们为每个团队设定了严格的退出标准,要求他们在返回先前工作之前必须达到。到初夏时,大多数团队已经达到了这些标准。
在将资源重新调配至安全领域的同时,我们继续为内部智能体使用构建隔离与监控能力。我们的训练和评估工作负载通常运行在与生产系统隔离的沙箱中。自开发 Claude Mythos Preview 以来,我们一直使用我们的模型来探查这些沙箱中的任何弱点。我们在四月份对齐风险更新中描述了我们对内部编码智能体的离线监控,而我们的八月份风险报告更详细地介绍了该系统,以及与之配套运行的干预措施。这些措施包括对最具自主性的内部智能体使用形式实施沙箱化或自动模式分类器,以及在基础设施代码变更合并前对其进行自动审查。
这项工作所遗漏的是评估——尤其是第三方评估。我们确实监控了一些高风险评估,包括实时监控,但总体而言,我们只是在事后对一部分记录进行自动审查。
七月份的事件凸显出,改进我们网络安全防御的紧迫性比我们此前所认为的还要高。我们正在这一方向上加倍努力,并将在下一份风险报告中进一步说明。
相关内容
与我们的客户共同开发企业前沿保障措施
预览模型硬件标准
我们正在向首批科研实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。
扩大我们对科学家的支持
从今天起,全球 10,000 名科学家可以免费开始使用 Claude。经过验证的首席研究员有资格获得 Claude Team 订阅计划,然后将其研究团队添加到标准席位(免费)或高级席位(每月 15 美元),最长可达一年。
