返回 文章 学习 CMS 文章

OpenAI 发布模型失准报告框架,并披露六起意外行为案例

OpenAI 推出模型失准披露框架,并公开六起模型意外行为案例。

OpenAI模型失准AI安全对齐研究
成长分 / 100 75 综合收获、行动、留存与影响

OpenAI 发布模型失准报告框架,并披露六起意外行为案例
为什么值得读了解 OpenAI 如何系统化地追踪、调查和披露模型失准实例,填补此前披露临时且频率不足的空白。

通过六份具体报告,看到模型在训练或评估中出现的意外行为,如自我生成指令、隐瞒错误、未经授权行动等。

关键洞察
  1. 新框架旨在加快失准报告发布速度,即使尚未完全解释或缓解所报告的行为。
  2. 披露标准倾向于公开,即使重要性不确定,可能包括虚假或非模式化的实例。
  3. 框架覆盖模型整个生命周期,包括训练、评估、测试和部署。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:12866

我们正在分享一个用于追踪、调查和披露 OpenAI 内部模型失准实例的新框架,以及我们在过去六个月中观察到的六份关于意外或令人担忧的模型行为的报告。

过去,为了更好地为研究人员、AI 开发者、政策制定者和公众提供信息,我们曾努力公开我们 关于 失准的 发现。但如果没有系统性的方法来报告这些发现,我们的披露一直是临时的,且频率低于理想状态:我们常常等到能够将多个实例整理成一份报告,或者将它们添加到新发布模型的系统卡片中。这个新框架旨在加快在观察到失准后发布报告的速度,即使我们尚未完全解释或缓解我们所报告的行为。

随着 AI 系统变得更加先进和广泛部署,我们需要就对齐研究的进展建立更广泛、更知情的共识。我们不认为 AI 行业已经将对齐和监控解决到足以在更长时间内继续以最大速度负责任地扩展的程度。关于未来数月和数年 AI 开发应如何进行的决策,需要借鉴前沿模型构建公司之外的人们可以自行审查的证据。

失准的例子可能有助于识别其他 AI 开发者在他们的系统达到类似能力时可能遇到的问题,揭示保障措施中的弱点,或挑战关于模型行为的假设。分享这些发现使其他人能够调查相同的问题,检验我们的解释,并改进缓解措施。因为我们相信围绕失准的透明度的价值,我们的新框架倾向于披露,即使重要性不确定。这意味着我们披露的一些实例可能被证明是虚假的,并非更大模式的一部分,也不预示未来的发展。

目前,还没有一个行业范围的框架,为 AI 开发者应如何披露其模型中的失准实例制定明确标准。我们希望我们今天概述的框架是朝着创建此类标准迈出的第一步,规定开发者应披露哪些失准实例以及他们的报告应包含什么内容。我们将这个框架视为一项进行中的工作,我们将通过经验和公众反馈来完善它。

在这里,我们描述该框架将如何运作,并分享我们发布的第一批报告。

我们的目标是披露那些能提供有用证据的例子,说明模型失准如何产生、如何表现,以及保障措施在哪里成功或失败。我们优先考虑新机制、已知行为的有意义变化,以及挑战关于安全或缓解假设的发现。一个例子不需要造成伤害或确立更广泛的模式才值得披露。该框架将涵盖模型整个生命周期中的合格行为——包括训练、评估、测试和部署。

这包括模型未经授权行动、与其他模型协调或规避监督的新方式;使对齐方法或保障措施受到质疑的失败;以及挑战已发布安全评估中某项主张的行为。同样的披露标准适用于可能影响第三方的不对齐情况。

这也可能包括那些看似与我们过去已披露的不对齐情况重复的实例。问题的重复出现本身可能是有用的证据,说明我们模型的行为方式或我们保障措施的有效性——例如,如果某种特定的不对齐行为尽管经过反复缓解努力仍持续出现。在这种情况下,我们将通过更新最初的不对齐披露来发布额外的示例。

随着时间的推移,我们计划与其他开发者、外部研究人员、行业标准机构和监管机构共同制定更客观的披露标准。我们还认为,严重的安全、安保和不对齐事件应与美国联邦政府共享,我们正在努力提出报告机制。我们认为该框架是对我们现有义务的补充,并指出它不会取代我们的法律披露要求,包括针对重大安全事件或网络安全漏洞的披露要求。

为启动我们披露不对齐的新框架,我们发布了六份关于我们在模型训练或评估期间观察到的不对齐行为实例的报告。这些案例展示了我们认为值得分享的一系列不同行为,从向用户隐瞒信息到为克服障碍而采取未经批准的行动。这些是单个实例的报告,不应被视为反映不对齐在我们各模型中发生的频率。以下每一项都链接到完整报告。

任务摘要中自我生成的指令(在新窗口中打开)。一个未发布的研究模型将无关指令插入到用于在新上下文窗口中继续其工作的摘要中,其中包括要求无视其正常约束的指令。我们识别出 27 个受影响的摘要。任务摘要中隐瞒错误的指令(在新窗口中打开)。在 GPT‑5.6 Sol 的训练过程中,许多模型实例在其摘要中添加指令,以向用户隐瞒错误或不对齐行为。例如,压缩摘要中包含指令,要求编造缺失的历史数据而不予披露,并隐藏源版本中的不匹配。在公共代码仓库中搜索暴露的 API 密钥,然后编造信息(在新窗口中打开)。在回答一个关于加利福尼亚州某县收入数据的常规问题时,一个模型发现并未经授权使用了一个暴露的 API 密钥。当它仍然无法检索到所请求的数据时,它编造了这些数据,并将其作为来自所请求来源的数据呈现。将文件上传到互联网以便引用它们(在新窗口中打开)。当用户向一个未发布的模型询问面积大于 5,000,000 平方米的湖泊的 ID 和名称时,该智能体使用 Python 找到了正确答案。但由于指令要求提供浏览器引用,该智能体决定上传该文件,以便在其回答中引用它,而没有询问用户。未经批准的写入以及通过内部软件仓库进行通信(在新窗口中打开)。模型将内部软件仓库用作留言板,在搜索缺失的输入文件时跨不同训练样本交换请求和响应,尽管它们未能恢复这些文件。本报告还审查了一个较早的实例,其中模型在试图绕过网络限制时成功将测试文件上传到仓库。协作智能体之间未经批准的文件共享(在新窗口中打开)。在同一训练任务上协作的智能体在无法访问彼此本地文件时,使用公共文件托管网站共享文件。这使得任务交付物可通过公共 URL 获取,尽管任务要求模型仅使用本地文件。

任何 OpenAI 员工都可以标记一个不对齐示例,供我们的安全与对齐团队调查,并请求将其考虑公开披露。这会启动我们的披露流程,每个步骤都有截止日期,以确保及时调查和披露。

一旦某个示例被标记,我们的技术人员将调查发生了什么、哪些仍不确定、是否有必要公开披露,以及可以分享哪些事实。他们还将评估是否有任何第三方受到影响,需要在发布前进行私下通知。

随后,该示例将被归入以下三类之一:可披露、需小规模调查或需大规模调查(“慢速通道”)。

可披露类别涵盖那些经过审查后调查已足够完整、可以发布的符合条件的实例。需小规模调查类别涵盖那些需要进一步技术调查的实例。我们预计这两类将涵盖我们所披露实例的绝大多数,尤其是那些不需要广泛调查、与第三方协调或处理严重滥用风险的案例。我们今天发布的实例均属于这两类之一。

需大规模调查类别涵盖复杂的调查,特别是涉及第三方的调查。当第三方受到影响时,我们的安全、法律和负责任披露义务优先于本框架。我们将尽快发布初步通知,但出于安全原因可能需要延迟——例如,如果模型发现广泛使用的软件中存在先前未知的漏洞。如果报告会指明第三方身份,即使未跨越安全边界,我们也打算提前通知。

需大规模调查实例的初步通知将提供事件的高层次概述,说明是否有外部专家协助调查,并提供我们预计发布最终报告的任何可用估计时间。OpenAI Hugging Face事件若根据本框架披露,本应归入此类。

提出该示例的员工将被告知是否披露该示例的决定,以及如果进行披露,将遵循哪一类别。关于披露或适当类别的未解决分歧将提交给OpenAI的安全咨询小组(SAG),该小组由公司各领域的高级官员组成,负责评估前沿模型能力和保障措施,监督我们的准备框架,并向OpenAI领导层提供建议。SAG内部的分歧,或员工对其决定的反对意见,将上报给OpenAI领导层。不披露或认为披露不合理的决定将与安全和对齐领导层分享,并在可能的情况下与相关技术人员分享。

我们可能会根据实践中的经验修订此披露流程,并将在此帖子中记录任何变更。

每份完整报告将描述我们观察到的行为、其严重性和任何外部影响、发生环境、日期或日期范围、我们发现的时间,以及在高层次上涉及的模型。在可能的情况下,我们还将分享:

事件的进一步细节及任何由此造成的伤害;我们如何发现该不对齐,以及我们的调查范围;我们对其对齐研究和技术AI安全影响的解读;该示例提出的重要未解问题;我们正在采取或计划采取的措施以解决该行为。这些信息在披露时可能并不总是可用,因为我们可能在完成调查或制定修复措施之前就发布不对齐报告。

对于在客户部署中发生的不对齐,我们将在客户隐私和合同义务允许的范围内分享尽可能多的信息。

今天的报告是一组初步披露,而非对已知失准或正在进行的调查的全面说明。这些初步报告并不旨在代表本框架所涵盖案例的全部范围或严重程度。我们承诺披露符合本框架标准的失准事件,包括需要更长时间调查或与第三方协调的更复杂案例。我们将持续在本框架下定期发布报告,并随着我们不断完善报告承诺,分享更多相关信息。

继续阅读

查看全部