返回 文章 学习 CMS 文章

OpenAI 发布有效第三方评估的优先事项与原则

OpenAI 提出第三方评估的优先领域与原则,以强化 AI 安全问责。

AI安全第三方评估OpenAI安全案例
成长分 / 100 71 综合收获、行动、留存与影响

OpenAI 发布有效第三方评估的优先事项与原则
为什么值得读了解 OpenAI 对第三方评估的官方立场和具体优先事项。

掌握有效第三方评估应遵循的核心原则,如独立性、透明度和安全保密。

关键洞察
  1. 第三方评估是平衡 AI 安全责任、扩大意见输入和让实验室对安全声明负责的关键。
  2. 四个优先评估领域:安全案例的独立评估、关键保障措施的评估、能力与对齐评估的评估、关键失准事件的独立调查。
  3. 评估应基于明确界定且双方达成一致的评估主张,并确保相称的访问权限。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:14830

有效第三方评估的优先事项与原则

前沿人工智能实验室在安全地训练、评估和部署模型方面肩负着重大责任。第三方评估是平衡这一责任、扩大人工智能安全意见输入机会、让世界了解情况、并使实验室对明确且获得独立支持的安全声明负责的关键部分。

作为我们紧跟前沿努力的一部分,OpenAI 致力于支持独立评估,并在训练、评估和部署方面提供深度访问权限。这种访问应使评估者能够挑战我们的假设,识别我们可能遗漏的风险,并就我们保障措施的有效性得出自己的结论。

我们长期以来在模型开发和部署过程的各个阶段与第三方评估者合作。我们还将第三方评估纳入我们的准备框架实践,并支持倡导更严格、更负责任流程的组织和立法。在这些合作中,我们提供了深度访问形式,包括有关我们技术保障措施的信息、可见的思维链访问权限,以及为事件响应和监控红队测试提供的前所未有级别的机密数据和内部部署访问权限。此处分享的优先事项和原则侧重于我们与私营和非营利部门的独立评估组织在技术安全评估方面的合作。它们补充了我们与政府在测试和评估方面的工作,后者可能因不同的角色和职责而需要不同的方法。

要使这些评估有效,需要强有力的独立性机制、科学严谨性、稳健的安全实践和明确的责任。实验室有责任在保护敏感信息的同时实现有意义的审查。实验室和独立评估者共同承担做好这项工作的责任,并应按照安全与安保实践的共享国际标准运作。下面,我们提出四个需要更深入评估的优先领域,以及严谨、安全和独立工作的原则。

第三方评估在解决具体且重要的问题时最为有用:证据是否支持实验室的安全论证和安全声明?评估是否充分测试了它们旨在衡量的风险?保障措施在现实条件下是否有效?

此处描述的评估旨在根据所审查的安全问题采取不同形式。我们预计将并行支持多项评估,并在不同时间段内进行,有些持续数周,有些持续数月。虽然第三方评估也可以作为部署前工作的一部分,并可能为部署决策提供信息,但此处描述的工作通常是长期且与发布无关的——侧重于随时间推移深入审查特定的安全声明。

在我们的优先领域和原则中,我们提到了安全声明和安全论证。这些术语的含义如下:

安全声明: 关于模型或系统能力、行为或保障措施的具体断言,涉及其安全性,并可根据证据进行评估。声明应明确其针对的风险和条件,以及相关假设和限制。

安全案例: 一种结构化论证,由证据支持,解释为何模型或系统在特定活动(如训练、评估或部署)中的风险得到充分管理。安全案例将各个安全声明与支持它们的证据联系起来,并明确可能影响其结论的假设、不确定性和剩余风险。

我们提出四个优先领域进行深入评估,同时提出严谨、安全和独立工作的原则。

安全案例的独立评估,涵盖训练、评估、内部部署和外部部署。 安全案例的评估需要对齐、控制方法(如监控)、网络安全、生物和化学滥用以及红队方面的专业知识。安全案例由包括训练、能力评估和保障措施在内的声明组成,可以整体或部分进行评估(见下文优先事项2和3)。多个评估者可能需要根据各自的专业知识审查案例的不同部分。他们的评估应共同回答以下问题:

训练、评估和部署的安全案例证据是否得到证实?在训练、评估和部署期间是否遵循了安全案例的条件?

我们的安全案例是否涵盖了评估过程中发现的最紧迫风险?安全声明是否支持整体安全案例?是否存在任何差距或改进空间?

是否使用了有效方法来识别和减少训练中可能奖励欺骗、奖励黑客、破坏性行为或规避限制的激励?

关键保障措施的评估,涵盖内部和外部部署 我们的保障措施栈始终在不断发展,以应对不断变化的能力和格局。我们的保障措施涵盖训练、内部部署和外部部署。它们目前包括模型级保障、执行保障和安全保障,以及失准监控——覆盖各种风险(如失控,以及网络、生物和化学风险中的滥用)。技术合作伙伴关系可以识别当前保障措施中的弱点,同时改进评估方法并加速标准制定,为未来公共政策跟上前沿提供更强的技术基础——特别是对于内部部署,其安全和安保标准仍处于起步阶段。

独立评估应检查这些保障措施的有效性以及可能不足之处,例如:

使用“灰盒”访问,保障措施是否能够抵御对抗性测试(越狱),并且是否足以防止高风险领域(如网络、生物)的能力提升?我们的对抗性测试和红队是否覆盖了最重要的风险?

在现实操作条件下的授权测试中,代理如何与访问控制、沙箱以及检测和响应系统等网络防御互动?哪些防御措施能够预防、检测或遏制有害行为,哪些地方会失败?

我们的失准监测器是否存在任何关键缺口,可能导致内部和外部部署中失去控制或严重失准?随着模型能力的提升,思维链监测作为安全或对齐证据来源的可靠性如何?

是否在所有相关的训练、评估和部署中都实施了适当的监测,且这种监测不易被禁用?

是否实施了与能力相称的保障措施?

对涵盖 Preparedness 风险类别(化学与生物风险、网络安全、AI 自我改进)的能力评估以及针对失准风险的对齐评估的评估我们的 Preparedness 框架要求评估关键前沿风险领域。随着阈值被超越且评估饱和,持续更新并确保评估覆盖范围和质量至关重要,这些评估旨在评估 Preparedness 风险领域的能力,以及旨在评估严重失准风险的对齐评估。

相关问题包括:

评估 Preparedness 风险的评估是否充分覆盖了 Preparedness 风险阈值定义?这些评估的阈值设置是否正确?

当模型持续获得最高分时,评估是否会更新,新测试是否真正衡量了更高级的能力?

我们的对齐评估是否充分覆盖了严重失准风险,它们可能遗漏哪些重要行为或条件?

对关键失准事件的独立调查独立调查在一系列关键 AI 安全事件中可能具有价值。在此,我们关注模型失准,包括模型未经授权行动或规避监督,这可以揭示对齐方法和保障措施中的弱点,即使没有故意滥用。

在特定情况下,如 OpenAI Hugging Face 事件,引入独立第三方进行独立的

失准事件调查可能是有益的。参与事件调查的第三方必须具备调查所需的专业知识,包括在适用情况下:网络取证专业知识、对齐专业知识、大规模思维链分析,以及能够及时进行调查的人员和资源。事件响应可能涉及访问敏感内部数据和第三方数据,因此某些细节可能不宜发布或访问。独立调查的发现还可以通过提供证据来评估关于模型对齐的主张以及为补救先前观察到的失准所采取措施的有效性,从而为模型的安全案例提供信息。在失准事件的背景下,我们优先考虑对以下方面进行独立评估:

事件过程中发生了什么模型行为或失准问题,主要促成因素是什么?

保障措施和补救措施是否能有效缓解未来类似事件?

明确界定且双方达成一致的评估主张:评估应始于双方达成一致的范围,随后在评估活动开始前预先登记明确定义的安全主张。第三方和实验室应澄清这些主张是被评估公司希望提出进行评估的主张,还是第三方评估者旨在独立评估且实验室同意接受评估的主张。某些主张可能超出范围的原因有很多,包括第三方无法获取数据、评估者专业知识不足,或评估紧急时合理的时间限制。实验室和评估者应建立一套流程,用于考虑在原始范围之外发现的重大风险,包括是否需要进一步调查。结论应明确说明哪些内容已评估、哪些未评估,并与双方达成一致的范围相关联。相称的访问权限:在法律、安全和知识产权限制的范围内,评估者应尽可能拥有相称的访问权限,以评估已达成一致的主张。在直接访问不切实际或不可能的情况下,评估者可以与公司指定代表合作,或探索间接或隐私保护访问机制,以保护底层信息。透明的方法论和标准:评估者应解释其方法、评估标准和不确定性,并在有既定标准时借鉴这些标准。在标准尚不存在的情况下,他们应清楚说明所用标准的合理性。报告应区分直接发现与解释,说明不确定性,并明确证据支持哪些结论。专业知识和独立性:评估者应展示相关技术专业知识,并识别、披露和解决组织及个人利益冲突,包括财务激励、与开发者的关系,以及先前参与被评估工作的情况。应设计保障措施,确保商业压力和薪酬安排不影响发现结果,其中可包括回避或适当的排除期。安全与保密:评估者应展示信息安全实践和可执行的保密保护措施,覆盖其人员,并与所访问系统和信息的敏感性相称。这些保护措施应涵盖知识产权、敏感信息和评估记录。当评估者无法在其自身环境中满足安全要求,或所访问的数据特别敏感时,在公司管理的设备或场所进行访问可能是合适的。可操作的发现和补救时间:评估应识别具体差距,并提供足够细节供实验室解决。在适当情况下,实验室应在发布前有合理时间补救问题。在相关情况下,报告还应解释对智能体开发者、部署者和防御者的经验教训,并提供可实施的实用建议。负责任的发布实践:评估报告应以证据为基础,并在保护敏感和机密信息的同时尽可能公开分享。在无法完全公开披露的情况下,向适当的监督机构(如公司治理机构或董事会)进行保密报告可以支持问责。

ty。应当建立有原则的删节保护措施和政策,以及对反馈和纠正不准确之处的明确预期,以维护独立性与保密性之间的平衡。评估者应保持编辑独立性,同时确保保密和知识产权保护得到维持。评估者应采用明确的删节政策,允许实验室请求对敏感信息进行删节,同时评估者可以注明在何处进行了实质性删节及其对评估报告的影响。

我们致力于支持独立评估机构,并建立更清晰、共享的国际标准——既通过未来的法律,也通过私人治理机构——以实现有效的第三方评估。虽然独立评估生态系统仍在成长,我们将通过支持并与在前沿安全问题上拥有深厚专业知识的多元化独立评估机构社区合作,帮助其成长。没有任何一个第三方能够或应该全面覆盖紧迫的前沿安全问题。我们将审慎而有意识地行动,以增强自身能力,并使不断成长的第三方生态系统能够在最佳实践和原则上达成一致。我们正在与多个第三方就与上述优先领域相符的提案进行对话。

作者

继续阅读

查看全部