返回 文章 apply CMS 文章

Meta 发布先进 AI 扩展框架:如何评估与部署最强模型

Meta 用更严格的先进 AI 扩展框架,把安全评估从规则驱动升级为原则驱动,并公开安全与准备报告。

AI安全前沿模型风险评估模型治理
成长分 / 100 77 综合收获、行动、留存与影响

Meta 发布先进 AI 扩展框架:如何评估与部署最强模型
为什么值得读了解前沿 AI 模型在部署前如何被系统性地评估化学生物、网络安全和失控风险。

理解从逐场景规则训练到基于可测试原则的模型治理方式转变。

关键洞察
  1. 更新后的先进 AI 扩展框架拓宽了风险类型,新增失控相关风险评估章节。
  2. 评估方法多层次,在应用保障措施前后都测试模型,并监控实时流量发现意外问题。
  3. Muse Spark 因具备推理能力,使基于原则而非逐场景规则的治理方式成为可能。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5481

在我们打造能力更强、更个性化的 AI 时,可靠性、安全性和用户保护比以往任何时候都更加重要。

先进的模型需要先进的安全方法——一种能够随技术扩展的方法。今天,我们将详细说明这项工作:我们更新后的先进 AI 扩展框架,我们的

今天,我们在最初的 Frontier AI 框架基础上,发布一个经过大幅更新且更严格的版本:先进 AI 扩展框架。此次更新拓宽了我们评估的风险类型,强化了我们做出部署决策的方式,并引入了新的安全与准备报告。更具体地说,该框架概述了我们如何识别和评估最严重和新兴的风险,包括化学和生物、网络安全,以及一个评估失控相关风险的新章节。随着模型变得更加先进,我们正在评估它们在获得更大自主权时的表现,以及围绕该行为的控制措施是否按预期发挥作用。这些标准适用于我们的前沿部署,无论它们是开放的、受控 API 访问的,还是封闭模型。

在实践中,这也意味着绘制潜在风险图、在应用保障措施前后评估模型以确认它们在现实世界中有效,并且只有在模型达到我们框架设定的标准时才进行部署。对于在我们各应用中使用 Meta AI 的用户来说,这意味着为其体验提供支持的模型在可用之前,已经在广泛的风险范围内接受了评估。

虽然我们更新后的框架加强了我们最强能力模型的标准和保障措施,但我们新的安全与准备报告将展示我们如何达到这些标准。这些报告将详细说明我们的风险评估、评估结果、部署决策背后的理由,以及我们仍在努力解决的任何局限性。这种透明度意味着我们将分享我们发现了什么、我们如何测试模型、我们的评估在哪些方面存在不足,以及我们如何弥合这些差距。

对于 Muse Spark,我们在部署前进行了广泛的安全评估。由于其先进的推理能力,我们在应用保护措施前后都对模型进行了评估——不仅测试网络安全以及化学和生物威胁等最严重的风险,还对照我们长期以来的安全政策进行测试,这些政策旨在防止暴力和儿童安全违规、犯罪行为等伤害与滥用,以及我们确保意识形态平衡的政策。

我们的评估方法在设计上就是多层次的,并且从模型部署之前就开始。我们针对数千个专门设计用于发现弱点的场景进行测试,跟踪这些尝试成功的频率,并努力将该数字尽可能降低。由于没有评估是详尽无遗的,我们还通过旨在发现意外问题的自动化系统监控实时流量,以便我们能够迅速处理这些问题。结果表明,在我们衡量的所有风险类别中都有强有力的保障措施。我们的评估还显示,Muse Spark 在避免模型回复中的意识形态偏见方面处于前沿。

我们还评估了该模型是否可能以难以控制的方式自主行动,而我们的评估确认,它并不具备构成此类风险所需的自主能力水平。我们的《安全与准备报告》详细介绍了这一结论背后的具体评估,以及我们所有的评估结果,包括我们测试了什么以及发现了什么。

这些保护措施内置于每一个阶段——从过滤模型学习所依据的数据,到以安全为重点的训练,再到在产品层面运行的护栏。而且,由于我们的保护措施需要随着模型复杂度的提升而不断演进,这项工作永远不会完成。

特别是,Muse Spark 比我们上一代模型能力更强,而正是这种能力,使得一种从根本上全新的模型治理方式成为可能。早先的方法依赖于逐个教导模型处理特定场景,例如,训练它们拒绝回应或转而引导至可信来源。这种方法行之有效,但难以规模化。由于 Muse Spark 能够推理,我们改进了我们的方法:我们将我们在内容与对话安全、回复质量以及处理不同观点等领域的信任与安全准则,转化为清晰、可测试的原则。我们还就某件事为何安全对模型进行了训练——不仅是规则本身,还包括规则背后的原因。这意味着该模型更有能力处理基于规则的系统可能未能预见的新情况。

这项工作并不取代人工监督;它提升了人工监督。我们的团队设计指导模型行为的原则,针对现实世界场景严格验证这些原则,并叠加额外的护栏,以捕捉模型可能仍然遗漏的问题。其结果是,保护措施得到更广泛、更一致的应用,并随着模型推理能力的提升而改进。

随着我们对 Meta AI 做出重大改进并部署我们能力最强的模型,我们的《安全与准备报告》展示了我们如何在每一步评估和管理风险。我们将继续投资于保障措施、测试和研究,以便人们能够信赖一种内置保护措施、旨在帮助保障其安全的 AI 体验。