宣布我们更新后的负责任扩展政策

今天我们发布了对我们的负责任扩展政策(RSP)的重大更新,这是我们用来减轻前沿人工智能系统潜在灾难性风险的风险治理框架。 此次更新引入了一种更灵活、更细致的方法来评估和管理人工智能风险,同时保持我们的承诺:除非我们已实施足够的保障措施,否则不会训练或部署模型。关键改进包括新的能力阈值,以指示我们何时将升级保障措施;受安全案例方法论启发,改进了评估模型能力和保障措施充分性的流程;以及内部治理和外部输入的新措施。通过从我们的实施经验中学习,并借鉴其他高后果行业使用的风险管理实践,我们旨在更好地为人工智能的快速发展做好准备。
先进人工智能的前景与挑战
随着前沿人工智能模型的进步,它们有可能为我们的社会和经济带来变革性的好处。人工智能可以加速科学发现,彻底改变医疗保健,增强我们的教育系统,并为人类的创造力和创新创造全新的领域。然而,前沿人工智能系统也带来了新的挑战和风险,需要仔细研究和有效的保障措施。
2023年9月,我们发布了我们的负责任扩展政策,这是一个管理日益强大的人工智能系统风险的框架。经过一年的实施和学习,我们现在分享一个重大更新的版本,它反映了实践见解并考虑了不断进步的技术能力。
尽管这项政策侧重于如下所列类别的灾难性风险,但它们并不是我们监测和准备应对的唯一风险。我们的使用政策规定了我们产品的使用标准,包括禁止使用我们的模型传播错误信息、煽动暴力或仇恨行为,或从事欺诈或滥用行为的规则。我们不断完善我们的技术措施,以大规模执行我们的信任和安全标准。此外,我们进行研究以了解我们模型的更广泛的社会影响。我们的负责任扩展政策补充了我们在这些领域的工作,有助于我们理解当前和潜在的风险。
比例保障框架
和以前一样,我们保持我们的核心承诺:除非我们已实施将风险保持在可接受水平以下的安全和安保措施,否则我们不会训练或部署模型。我们的RSP基于比例保护原则:保障措施随潜在风险而扩展。为此,我们使用人工智能安全级别标准(ASL标准),这是一套随着模型能力增加而变得更加严格的安全和安保措施。受生物安全级别的启发,这些措施从ASL-1开始,适用于能力非常基本的模型(例如,下棋机器人),并逐步发展到ASL-2、ASL-3等。
在更新后的政策中,我们完善了评估特定能力(及其相关风险)并实施相称的安全与安保措施的方法。我们更新后的框架包含两个关键组成部分:
能力阈值:特定的 AI 能力,一旦达到,将需要比我们当前基线更强大的保障措施。所需保障措施:一旦达到能力阈值,为降低风险所需的具体 ASL 标准。
目前,我们所有的模型都在 ASL-2 标准下运行,这反映了当前的行业最佳实践。我们更新后的政策定义了两个需要升级保障措施的关键能力阈值:
自主 AI 研发:如果模型能够独立执行通常需要人类专业知识的复杂 AI 研究任务——可能以不可预测的方式显著加速 AI 发展——我们要求提高安全标准(可能是 ASL-4 或更高标准)并提供额外的安全保证,以避免发展速度超过我们应对新兴风险能力的情况。化学、生物、放射性和核(CBRN)武器:如果模型能够切实帮助具有基础技术背景的人制造或部署 CBRN 武器,我们要求加强安保和部署保障措施(ASL-3 标准)。
ASL-3 保障措施涉及增强的安保措施和部署控制。在安保方面,这将包括内部访问控制和更强大的模型权重保护。对于部署风险,我们计划实施多层方法来防止滥用,包括实时和异步监控、快速响应协议以及全面的部署前红队测试。
实施与监督
为促进政策的有效实施,我们建立了:
能力评估:基于我们的能力阈值进行常规模型评估,以确定我们当前的保障措施是否仍然适当。(过往评估的摘要可在此处获取。)保障措施评估:对我们安保和部署安全措施的有效性进行常规评估,以评估我们是否达到了所需保障措施的标准。(这些决定的摘要将在此处提供。)文档与决策:记录能力和保障措施评估的流程,其灵感来自高可靠性行业中常见的程序(如安全案例方法)。内部治理和外部输入的措施:我们的评估方法将得到内部压力测试的支持,此外还有我们现有的安全问题内部报告流程。我们也在就我们的方法征求外部专家反馈。1
从经验中学习
在上一版 RSP 生效的第一年里,我们学到了很多,并借此更新之机,反思哪些做法行之有效,哪些政策内容需要更新。为此,我们首次审查了自身对框架的遵守情况,发现少数未能完全达到其要求字面规定的情形。这些包括程序性问题,例如一组评估比计划晚三天完成,或者对于应如何及在何处记录占位评估的变更缺乏明确性。我们还标记了一些评估,在这些评估中,我们或许本可以通过实施标准技术(如思维链或最佳N选)来获得稍好的模型表现。
在所有情况下,我们发现这些情况对我们模型的安全性构成的风险极小。我们利用额外的三天时间精炼并改进了评估;我们使用的不同评估集比占位评估提供了更准确的评估;而且我们的评估方法仍然表明我们距离阈值足够远。由此,我们学到了两条宝贵的经验,并将其纳入更新后的框架:我们需要在政策中融入更多灵活性,并且需要改进跟踪 RSP 合规性的流程。您可以在此了解更多。
自一年前首次发布 RSP 以来,我们的目标一直是提供一个框架范例,供他人在制定自己的人工智能风险治理政策时借鉴。我们希望,主动分享我们实施自身政策的经验,将有助于其他公司实施其风险管理框架,并为在整个 AI 生态系统中建立最佳实践做出贡献。
展望未来
人工智能的前沿正在迅速发展,这使得预测未来系统适合采取哪些安全措施变得具有挑战性。我们安全计划的所有方面都将持续演进:我们的政策、评估方法、保障措施,以及我们对潜在风险和缓解措施的研究。
此外,联合创始人兼首席科学官 Jared Kaplan 将担任 Anthropic 的负责任扩展官,接替过去一年担任该职务的联合创始人兼首席技术官 Sam McCandlish。Sam 监督了 RSP 的初始实施,并将继续专注于其作为首席技术官的职责。在我们努力扩大实施 RSP 的工作规模之际,我们也在招聘一名负责任扩展负责人。该职位将负责协调迭代并成功遵守 RSP 所需的众多团队。
如果您希望为 Anthropic 的人工智能风险管理做出贡献,我们正在招聘!我们现在有许多团队通过 RSP 为风险管理做出贡献,包括:
- 前沿红队(负责威胁建模和能力评估)
- 信任与安全(负责制定部署保障措施)
- 安全与合规(负责安全保障和风险管理)
- 对齐科学(包括负责制定 ASL-3+ 安全措施、进行以失准为重点的能力评估以及我们的内部对齐压力测试计划的子团队)
- RSP 团队(负责政策起草、保证和跨公司执行)
请在 anthropic.com/rsp 阅读更新后的政策,并在 anthropic.com/rsp-updates 阅读补充信息。
我们衷心感谢众多外部团体,他们为我们负责任扩展政策的制定与完善提供了宝贵的反馈。
相关内容
与我们的客户共同制定企业前沿保障措施
改进我们的对齐与安全工作
7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与 METR 合作开展独立审查。与此同时,我们分享过去一个月中所做的一些改动。
预览模型硬件标准
我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。
